Ordre 20260912T193441Z-7358817909. Steg 1 var ikke transformen, men å rette
roadmapens R13-gate og få den ratifisert. Gaten `grep -rl "Cosmo"
skills/*/references -> 0` var usann på to uavhengige måter:
1. Ordren fanget den første: 451 av forekomstene er Azure Cosmos DB, ekte
produktinnhold. Diskriminatoren er ikke bokstaven «s» — `Cosmos <norsk
substantiv>` er genitiv av personaen (`### Cosmos tonalitet`), mens
`Cosmos DB`/`CosmosClient`/`cosmos_ru` er produkt.
2. Denne økten fant den andre: 132 persona-forekomster ligger i prosa,
tabeller, dialog-replikker og proveniens-linjer. Heading-nøytralisering
kan ikke nå dem, så «0 persona» er uoppnåelig også under den ratifiserte
formen. Operatøren ratifiserte alternativ A: gaten speiler formen, og de
132 bokføres til R13b/R14.
Tre korreksjoner av premisser som sto i ordren og STATE:
«ca 320 produkt» -> 451 (case-sensitivt nett manglet 327 lowercase
TOC-ankre + 99 identifikatorer; sann nevner 1 638)
«169 headinger» -> 401. 169 var `^## For Cosmo`-prefikset (168) og var
internt inkonsistent med sin egen topp-variant (204)
«417 matcher ingen
populasjon» -> 417 er cosmo-headinger utenfor kodefences; briefens
nevner var reell hele tiden
Fence-bevissthet er målt skadelig, ikke nødvendig: begge toggle-regler er
gale på dette korpuset (naiv toggle skjuler en ekte heading i
chain-of-thought-prompting.md, CommonMark-regelen ubalanserer
service-level-documentation-dr.md). Fence-agnostisk deteksjon finner 401
heading-linjer i nøyaktig de samme 40 variantene som fence-bevisst finner
400 i — ingen kodeblokk-linje er byte-identisk til en persona-heading. Derfor
nøkles transformen på 40 enumererte heading-tekster og ignorerer fences. En
ukjent variant kaster; en slug-kollisjon kaster. Ingenting auto-fikses.
TOC-en regenereres ikke, den rettes kirurgisk: alle 327 persona-lenker hadde
lenketekst lik én av de 40 heading-tekstene og anker lik slugify av den
(327/327, 0 avvik), så heading og TOC-entry skrives i samme operasjon og
ingen mellomtilstand etterlater en død lenke.
Ratifisert målform: `For Cosmo`, `For Cosmo Skyberg` og `For arkitekten
(Cosmo)` konvergerer på `For arkitekten`. To filer kolliderte og er adjudisert
ved å lese dem, ikke ved regel.
Verifisering (alle 7 kriterier fra ordren):
G1 persona på heading-linjer 401 -> 0
G2 døde fragmentlenker 1 -> 1 (pre-eksisterende, unntatt)
G3 produkt-forekomster 451 -> 451; `Cosmos DB|Azure Cosmos` 308 = 308
de 3 kun-produkt-filene byte-identiske
nettet validert begge veier injisert persona feller G1; genitiv feller G1;
produkt-heading og de 3 filene passerer
hele diffen 802 heading-linjer + 654 TOC-linjer, ANNET = 0
linjeantall 728 lagt til = 728 slettet
suite 1120/1120 (1097 + 23 nye)
validate-plugin 250 PASS / 0 FAIL
stikkprøve 10 filer, alle 5 skills, inkl. de 3 mest
produkt-tunge (26/20/19) — kun heading+TOC
Utenfor scope, urørt: de 4 SKILL.md, de 23 commands, CLAUDE.md, README.md,
NOTICE.md, docs/ (alt R14).
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
19 KiB
Norske NLP-benchmarks og språkkvalitetsvurdering
Last updated: 2026-02 (v1.0) Status: Gjeldende Category: Norwegian Public Sector AI Governance Type: reference
Innhold
- Introduksjon
- 1. Embedding-modell-sammenligning for norsk
- 2. Benchmark-referanser for norsk NLP
- 3. LLM norsk-kvalitet med fagterminologi
- 4. Chunking for norsk morfologi
- 5. Pilottest-anbefaling
- Norske NLP-ressurser og forskningsmiljøer
- For arkitekten
Introduksjon
Når en arkitekturvurdering hevder at "GPT-4o håndterer norsk godt", trenger vi et evidensrammeverk for å validere påstanden. Denne filen dokumenterer tilgjengelige benchmarks, embedding-modeller og kvalitetsvurderinger for norsk NLP, med fokus på modeller tilgjengelige via Azure OpenAI og Microsoft-stakken.
Norsk er et mellomstort språk med to offisielle skriftspråk (bokmål og nynorsk) og flere samiske språk. Alle store LLM-er og embedding-modeller behandler norsk som del av flerspråklige modeller -- det finnes per 2026 ingen norskspesifikke embedding-modeller fra Microsoft eller OpenAI.
1. Embedding-modell-sammenligning for norsk
Tilgjengelige modeller via Azure OpenAI
| Egenskap | text-embedding-3-large |
text-embedding-3-small |
multilingual-e5-large |
|---|---|---|---|
| Leverandør | OpenAI (via Azure) | OpenAI (via Azure) | Microsoft (open source) |
| Maks dimensjoner | 3072 | 1536 | 1024 |
| Justerbare dimensjoner | Ja (1--3072) | Ja (1--1536) | Nei (fast 1024) |
| Maks tokens | 8191 | 8191 | 514 |
| MTEB gjennomsnitt | 64.6 | 62.3 | 61.5 |
| MIRACL flerspråklig | 54.9 | 44.0 | 56.2 |
| SEB norsk (ca.) | ~65 | ~58 | ~61 |
| Pris (Azure, per 1M tokens) | $0.13 | $0.02 | Gratis (self-hosted) / Azure AI-pris |
| Hosting | Azure OpenAI managed | Azure OpenAI managed | Self-hosted eller Azure ML |
| Norskspesifikk trening | Nei (flerspråklig) | Nei (flerspråklig) | Nei (flerspråklig, 100+ språk) |
Scandinavian Embedding Benchmark (SEB) -- norske oppgaver
SEB (Enevoldsen et al., NeurIPS 2024) evaluerer embedding-modeller på skandinaviske språk med 24 oppgaver, 10 deloppgaver og 4 oppgavekategorier. Norske oppgaver inkluderer:
| Oppgave | Språk | Type | Beskrivelse |
|---|---|---|---|
| NorQuad | nb | Retrieval | Spørsmål-svar fra norsk Wikipedia |
| SNL Retrieval | nb | Retrieval | Gjenfinning fra Store norske leksikon |
| Norwegian Courts | nb, nn | Bitext Mining | Parallellkorpus fra norske domstoler |
| Norwegian Parliament | nb | Classification | Partiklassifisering fra Stortinget |
| ScaLA | nb, nn | Ling. Acceptability | Lingvistisk akseptabilitet |
| SNL Clustering | nb | Clustering | Klyngeanalyse av SNL-artikler |
| VG Clustering | nb | Clustering | Nyhetsartikkel-kategorisering |
Hovedfunn fra SEB
- Kommersielle API-er (OpenAI, Cohere) overgår generelt open-source-modeller på skandinaviske oppgaver, men gapet krymper.
text-embedding-3-largescorer best av de testede modellene på tvers av skandinaviske oppgaver (ca. 65.0 gjennomsnitt).multilingual-e5-largeer beste open-source-alternativ (ca. 60.7 gjennomsnitt) og gir best balanse mellom ytelse, hastighet og embedding-størrelse.- Nynorsk er underrepresentert -- de fleste norske oppgaver er kun bokmål, noe som gir usikkerhet om nynorsk-ytelse.
- Retrieval-oppgaver viser størst variasjon mellom modeller -- her er modellvalg mest kritisk for RAG-arkitekturer.
Anbefaling for Azure-arkitekturer
| Scenario | Anbefalt modell | Begrunnelse |
|---|---|---|
| RAG i produksjon (Azure OpenAI) | text-embedding-3-large (256--1024 dim) |
Best norsk retrieval, justerbare dimensjoner for kostnad/ytelse |
| Kostnadssensitiv RAG | text-embedding-3-small |
85% av ytelse til 15% av prisen |
| Self-hosted / on-prem | multilingual-e5-large-instruct |
Beste open-source, ingen API-kostnad |
| Hybrid (søk + semantisk) | text-embedding-3-large + Azure AI Search |
Kombinert keyword + vektor gir best norsk retrieval |
2. Benchmark-referanser for norsk NLP
NorBench (UiO, NoDaLiDa 2023)
NorBench er den første standardiserte benchmark-suiten for norske språkmodeller, utviklet av Language Technology Group ved Universitetet i Oslo (ltgoslo).
- Oppgaver: 9 NLU-oppgaver inkludert sentimentanalyse, NER, POS-tagging, lingvistisk akseptabilitet
- Datasett: NoReC (sentiment), NorNE (NER), UD Norwegian (POS/dependency parsing)
- Språk: Bokmål og nynorsk
- Leaderboard: HuggingFace (ltgoslo/norbench)
- Begrensning: Primært encoder-modeller, ikke designet for generative LLM-er
NorEval (UiO, ACL 2025 Findings)
NorEval er den nyeste og mest omfattende benchmark-suiten for norske generative språkmodeller.
- Oppgaver: 24 datasett (5 helt nye) over 9 kategorier
- Kategorier: Sentimentanalyse, norsk språkkunnskap, verdenskunnskap, leseforståelse, sunn fornuft-resonnering, maskinoversettelse, tekstsammendrag, instruksjonsfølging, sannferdighet
- Språk: Både bokmål og nynorsk (eksplisitt fokus)
- Evaluerte modeller: 19 open-source modeller (pretrained og instruction-tuned)
- Menneskebaseline: Ja -- etablerer menneskelig ytelsesnivå for sammenligning
- Integrasjon: LM Evaluation Harness (EleutherAI) for reproduserbarhet
- Tilgang: GitHub (ltgoslo/noreval), åpent tilgjengelig
ScandEval (NoDaLiDa 2023, oppdatert)
ScandEval er en bredere skandinavisk benchmark som dekker dansk, svensk, norsk (bokmål og nynorsk), islandsk og færøysk.
- Oppgaver: 4 hovedkategorier per språk -- lingvistisk akseptabilitet, NER, spørsmål-svar, sentimentanalyse
- Funn for norsk: Investering i norsk språkteknologi har gitt modeller som overgår massivt flerspråklige modeller (XLM-RoBERTa, mDeBERTaV3)
- Kryssspråklig: Betydelig overføring mellom fastlandsskandinaviske språk (NO/SV/DA)
- Leaderboard: scandeval.com
- Python-pakke:
pip install scandevalfor reproduserbare evalueringer
MTEB / MMTEB (flerspråklig)
Massive Text Embedding Benchmark (MTEB) og den flerspråklige utvidelsen MMTEB (februar 2025) dekker 500+ oppgaver over 250+ språk.
- Norsk dekning: Via integrasjon med Scandinavian Embedding Benchmark (SEB)
- Oppgavetyper: Retrieval, classification, clustering, reranking, bitext mining
- Leaderboard: huggingface.co/spaces/mteb/leaderboard (filtrerbar på norsk)
- Funn:
multilingual-e5-large-instruct(560M parametre) overgår mange milliarder-parametre-modeller på flerspråklige oppgaver
NLEBench (2023--2024)
Norwegian Language Evaluation Benchmark for generative modeller, med fokus på oversettelse og menneskelig annotasjon.
- Modeller: NorGLM-serien (norske GPT-modeller i ulike størrelser)
- Relevans: Viser at dedikerte norske modeller kan matche flerspråklige modeller på spesifikke oppgaver
Oversikt over norsk dekning
| Benchmark | Bokmål | Nynorsk | Generative LLM-er | Embedding-modeller | Menneskebaseline |
|---|---|---|---|---|---|
| NorBench | Ja | Ja | Nei | Nei | Nei |
| NorEval | Ja | Ja | Ja | Nei | Ja |
| ScandEval | Ja | Ja | Delvis | Nei | Nei |
| SEB/MTEB | Ja | Delvis | Nei | Ja | Nei |
| NLEBench | Ja | Nei | Ja | Nei | Ja |
3. LLM norsk-kvalitet med fagterminologi
Språkrådets test av GPT-4o (oktober 2024)
Språkrådet (Norwegian Language Council) gjennomførte den mest grundige uavhengige testen av GPT-4o på norsk. Testoppsettet: 157 sider tekst (ca. halvparten bokmål, halvparten nynorsk), vurdert av fire erfarne språkrevisorer.
| Mål | Bokmål | Nynorsk |
|---|---|---|
| Feil per side | 2.6 | 8.0 |
| Feil per 100 ord | 1.3--2.2 | ~5.1 |
| Dominerende feiltyper | 70% tegnsetting/stor bokstav | 21% bøyningsformer, 20% bokmålsord |
| Alvorlighetsgrad | Milde (skader ikke teksten) | Alvorlige (meningsendring, feil språkform) |
Kjente problemer med LLM-er på norsk
Bokmål:
- Inkonsekvent formvalg (veksler mellom "stein" og "sten" i samme tekst)
- Prefererer konservative former ("fremtid" over "framtid", selv om begge er tillatt)
- Engelskpåvirkning -- setninger som er direkte oversettelser fra engelsk
- Tegnsetting følger ofte engelske regler (kommabruk, kolon)
Nynorsk:
- Betydelig dårligere enn bokmål -- 3x høyere feilrate
- Blander inn bokmålsord som ikke finnes i nynorsk
- Feil bøyningsformer (svak/sterk bøyning)
- Treningsdata-bias: langt mindre nynorsk i treningsdataene
Samiske språk (nordsamisk, sørsamisk, lulesamisk):
- LLM-er har tilnærmet null funksjonell støtte for samiske språk
- GPT-4o kan oversette enkeltord men feiler på setningsnivå
- Dedikerte verktøy (Neurotolge/Giellatekno) er overlegne for samisk
- Relevant for offentlig sektor som har kommunikasjonsplikter overfor samiske språkbrukere
Modellsammenligning for norsk (kvalitativ vurdering)
| Dimensjon | GPT-4o | GPT-4o-mini | o3-mini |
|---|---|---|---|
| Bokmål generelt | God (med forbehold) | Akseptabel | God |
| Nynorsk | Svak--middels | Svak | Ukjent |
| Juridiske termer | Middels--god | Svak--middels | Middels |
| Forvaltningsspråk | Middels | Svak | Middels |
| Fagterminologi (helse, teknisk) | God (ofte anglisert) | Akseptabel | God |
| Konsistens i lang tekst | Svak (formveksling) | Svak | Middels |
| Instruksjonsfølging på norsk | God | Akseptabel | God |
Utfordringer med offentlig sektor-terminologi
- Juridiske termer: "Vedtak", "enkeltvedtak", "forhåndsvarsel", "klageadgang" -- modellene kjenner begrepene men bruker dem ikke alltid korrekt i juridisk kontekst
- Forvaltningsspråk: "Saksbehandling", "tilsynsmyndighet", "høringsinstans" -- variabel kvalitet, ofte forenklet
- Planspråk: "Reguleringsplan", "detaljreguleringsplan", "kommuneplanens arealdel" -- spesifikke norske begreper som modellene ofte oversetter feil fra engelsk
- NAV/helse-terminologi: "Arbeidsavklaringspenger", "uføretrygd", "dagpenger" -- kjente begreper men kontekstuell bruk varierer
- Samisk forvaltning: Terminologi knyttet til Sametinget, samiske rettigheter, reindrift -- svært begrenset støtte
Vurderingsmatrise for norsk LLM-kvalitet
For å vurdere om en LLM-løsning har tilstrekkelig norsk kvalitet for en gitt brukscase:
| Kriterium | Vekt | Evalueringsmetode |
|---|---|---|
| Terminologisk presisjon | Høy | Ekspertvurdering mot fagordbok |
| Bokmål korrekthet | Høy | Språkrådet-metoden (feil/side) |
| Nynorsk korrekthet | Middels--høy | Språkrådet-metoden + nynorsk ekspert |
| Formkonsistens | Middels | Automatisert (regelsjekk) |
| Kontekstuell riktig bruk | Høy | Domeneekspert-vurdering |
| Kulturell tilpasning | Middels | Brukertest med målgruppe |
4. Chunking for norsk morfologi
Norskspesifikke utfordringer
Norsk (særlig bokmål) er et germansk språk med produktiv sammensetning og rik bøyning, noe som påvirker chunking og tokenisering i RAG-systemer.
Sammensatte ord (compound words):
- "Arbeidsmiljøloven" = arbeid + miljø + loven (3 semantiske enheter)
- "Personvernkonsekvensvurdering" = personvern + konsekvens + vurdering
- "Kommunehelsetjenesteloven" = kommune + helse + tjeneste + loven
- Standard tokenizers splitter disse inkonsekvent, noe som påvirker embedding-kvalitet
Bøyningsformer:
- Substantiv: 4 former (ubestemt/bestemt x entall/flertall)
- Verb: Flere tider og former
- "Utredning", "utredningen", "utredninger", "utredningene" -- bør alle matche semantisk
Bokmål vs. nynorsk i samme korpus:
- Samme begrep kan ha ulik form: "utredning" (bm) vs. "utgreiing" (nn)
- RAG-systemet må håndtere begge former for å gi komplett gjenfinning
Chunking-strategier for norsk
| Strategi | Styrker for norsk | Svakheter for norsk | Anbefalt bruk |
|---|---|---|---|
| Token-basert (fast antall tokens) | Enkel, forutsigbar | Kutter midt i sammensatte ord, ignorerer setningsgrenser | Kun som fallback |
| Setningsbasert | Respekterer norsk setningsstruktur | Variabel chunk-størrelse, korte setninger gir små chunks | Generell tekst |
| Semantisk (Azure AI Search) | Opprettholder meningsbærende enheter | Krever god norsk språkmodell | Beste for RAG |
| Dokumentstruktur | Følger overskrifter og avsnitt | Avhenger av konsistent formatering | Strukturerte dokumenter (lover, forskrifter) |
| Hybrid (setning + overlapp) | Fanger kontekst på tvers av grenser | Økt lagringsbehov | Juridiske tekster |
Anbefalte innstillinger for norsk RAG
Chunk-størrelse: 512--1024 tokens (norsk tekst er ~15% lengre enn engelsk per semantisk enhet)
Overlapp: 50--100 tokens (fanger kontekst ved chunk-grenser)
Separator-hierarki: Avsnitt > Setning > Komma/kolon
Preprocessing: Normaliser bokmål/nynorsk-varianter i metadata
Indeksering: Bruk Azure AI Search med norsk analyzer ('nb.microsoft' eller 'nn.microsoft')
Azure AI Search norske analyzers
Azure AI Search tilbyr spesifikke norske språkanalyzere:
nb.microsoft-- Norsk bokmål (Microsoft)nb.lucene-- Norsk bokmål (Apache Lucene)- Støtter lemmatisering, dekomponering av sammensatte ord, og stoppord-fjerning
- Viktig: Bruk
nb.microsoftfor best norsk dekomponering av sammensatte ord
5. Pilottest-anbefaling
Når benchmarks ikke er tilstrekkelige
Eksisterende benchmarks dekker ikke alle brukstilfeller for norsk offentlig sektor. En pilottest er nødvendig når:
- Domenespesifikk terminologi -- benchmarks har ikke juridisk, medisinsk eller forvaltningsspesifikt testmateriale
- Nynorsk er kritisk -- de fleste benchmarks har begrenset nynorsk-dekning
- Sammensatte dokumenttyper -- blandede dokumenter (tekst + tabeller + skjema)
- Samisk språk er involvert -- ingen benchmarks dekker samisk
- Høy presisjonskrav -- offentlige vedtak krever høyere nøyaktighet enn benchmarks måler
Pilottest-protokoll
Fase 1: Forberedelse (1--2 uker)
| Element | Krav |
|---|---|
| Testdatasett | Minimum 200 dokumenter fra reelt domene |
| Spørsmålssett | Minimum 100 spørsmål med fasitsvar |
| Språkfordeling | Minimum 30% nynorsk hvis relevant |
| Terminologi | Minimum 50 domenespesifikke termer med fasit |
| Evaluatorer | Minimum 2 fageksperter + 1 språkrevisor |
Fase 2: Gjennomføring (1--2 uker)
1. Embedding-evaluering:
- Indekser testkorpus med 2-3 embedding-modeller
- Kjør spørsmålssett mot alle varianter
- Mål: Recall@10, MRR, nDCG for norsk retrieval
2. LLM-evaluering:
- Generer svar på testspørsmål med 2-3 modeller
- Vurder terminologisk presisjon
- Mål: Feil per side (Språkrådet-metoden), BLEU/ROUGE for sammendrag
3. End-to-end RAG-evaluering:
- Kombiner beste embedding + LLM
- Test med reelle brukerscenarier
- Mål: Task completion rate, brukertilfredhet (1-5)
Fase 3: Analyse og dokumentasjon (1 uke)
| Leveranse | Innhold |
|---|---|
| Ytelsesrapport | Kvantitative resultater for alle modellkombinasjoner |
| Feilanalyse | Kategoriserte feil med eksempler |
| Anbefaling | Valgt arkitektur med begrunnelse |
| Baseline | Dokumenterte baseline-tall for fremtidig sammenligning |
| Akseptkriterier | Definerte terskelverdier for produksjonsklarhet |
Dokumentasjonsmal for pilotresultater
# Pilottest: [Prosjektnavn] -- Norsk NLP-kvalitet
## Metadata
- Dato: [YYYY-MM-DD]
- Evaluatorer: [Navn, rolle]
- Modeller testet: [Liste]
- Domene: [Beskrivelse]
## Embedding-resultater
| Modell | Recall@10 (nb) | Recall@10 (nn) | MRR | Latens (ms) |
|--------|-----------------|-----------------|-----|-------------|
| ... | ... | ... | ... | ... |
## LLM-resultater
| Modell | Feil/side (nb) | Feil/side (nn) | Terminologi-score |
|--------|----------------|----------------|-------------------|
| ... | ... | ... | ... |
## RAG end-to-end
| Konfigurasjon | Task completion | Brukertilfredhet | Kommentar |
|---------------|-----------------|-------------------|-----------|
| ... | ... | ... | ... |
## Anbefaling
[Begrunnelse for valgt arkitektur]
## Kjente begrensninger
[Dokumenterte svakheter og akseptert risiko]
Norske NLP-ressurser og forskningsmiljøer
| Miljø | Fokus | Ressurser |
|---|---|---|
| LTG, UiO (Language Technology Group) | NorBench, NorEval, norske BERT-modeller | github.com/ltgoslo |
| NorwAI, NTNU | NorLLM, domenetilpassede norske modeller | ntnu.edu/norwai |
| Nasjonalbiblioteket (NB) | NbAiLab, norske treningsdata og modeller | github.com/NbAiLab |
| Språkbanken | Norske språkressurser, korpus, ordbøker | sprakbanken.no |
| Språkrådet | Norsk språkkvalitet, anbefalinger | sprakradet.no |
| Giellatekno, UiT | Samiske språkteknologiverktøy | giellatekno.uit.no |
For arkitekten
Når brukes denne filen
- Ved alle arkitekturvurderinger som involverer norsk tekst (RAG, chatbot, dokumentbehandling)
- Når kunden spør om "GPT-4o håndterer norsk" -- referer til Språkrådets test
- Ved embedding-modellvalg -- bruk SEB-tallene for å begrunne anbefaling
- Når nynorsk er krav -- flagg at dette er en kjent svakhet
- Ved samisk behov -- flagg at LLM-er ikke støtter dette, og anbefal dedikerte verktøy
Nøkkelpunkter for arkitekturforslag
- Aldri påstå at en modell "håndterer norsk godt" uten evidens -- referer til benchmarks eller anbefal pilottest
- Embedding-valg:
text-embedding-3-largefor best norsk retrieval via Azure OpenAI;multilingual-e5-large-instructfor self-hosted - Nynorsk er 3x dårligere enn bokmål i GPT-4o -- dette må adresseres eksplisitt i løsningsforslag
- Chunking: Bruk semantisk chunking med norsk analyzer (
nb.microsoft) i Azure AI Search - Pilottest er påkrevd for domenespesifikke brukstilfeller -- benchmarks gir kun indikasjoner
- NorEval (2025) er den autoritative benchmarken for å sammenligne generative modeller på norsk
- Sammensatte ord er en reell risiko for retrieval-kvalitet -- test med domenespesifikke sammensatte termer
Sjekkpunkt i arkitekturprosessen
Legg til dette som et eksplisitt steg i fase 4 (kunnskapsvalidering):
[ ] Er norsk språkkvalitet validert med benchmarks eller pilottest?
[ ] Er embedding-modell valgt basert på SEB/MTEB norske resultater?
[ ] Er nynorsk-krav identifisert og adressert?
[ ] Er chunking-strategi tilpasset norsk morfologi?
[ ] Er samisk språkbehov kartlagt?
[ ] Er pilottest planlagt for domenespesifikk validering?