From 2b6fb62f53a8c238b3743f0ca004ef313c29f7a6 Mon Sep 17 00:00:00 2001 From: Kjell Tore Guttormsen Date: Fri, 26 Jun 2026 21:37:47 +0200 Subject: [PATCH] =?UTF-8?q?docs(ms-ai-architect):=20n=C3=A6r-100%=20korrek?= =?UTF-8?q?thets-program=20+=20kontinuerlig-trust-mekanisme=20+=20Spor=200?= =?UTF-8?q?-fiks-manifest=20[skip-docs]?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Operatør-mandat: alle reference-filer 100% til å stole på til enhver tid + mekanisme som sikrer det. Full kvalitetsoffensiv godkjent (Spor 0 først, så skala). - docs/ref-kb-correctness-program-2026-06.md: 4 spor + MEKANISMEN (§4) — invariant håndhevet av 3 porter (frontmatter-kontrakt / create-time-guard / kadens-judge); ærlig tak (sample vs korpus, asymptotisk 100%, pris uverifiserbar); Voyage-plan; nordstjerne-verifisering (ferskt gull-utvalg, mål <2% feilrate). - spor0-fix-manifest.json: 38 deterministiske fikser (25 filer), hver reverify_required. Spor 0 utføres i fokusert sesjon m/ kilde-reverifisering (kvalitetsbar > hastverk). --- docs/ref-kb-correctness-program-2026-06.md | 87 ++++ scripts/kb-eval/data/spor0-fix-manifest.json | 505 +++++++++++++++++++ 2 files changed, 592 insertions(+) create mode 100644 docs/ref-kb-correctness-program-2026-06.md create mode 100644 scripts/kb-eval/data/spor0-fix-manifest.json diff --git a/docs/ref-kb-correctness-program-2026-06.md b/docs/ref-kb-correctness-program-2026-06.md new file mode 100644 index 0000000..4a2ace8 --- /dev/null +++ b/docs/ref-kb-correctness-program-2026-06.md @@ -0,0 +1,87 @@ +# Program — Reference-fil-korrekthet mot nær-100 % + mekanisme som holder den der + +_Opprettet 2026-06-26. Operatør-mandat (eksakt): «Alle reference-filene må til enhver tid være 100 % til å stole på, og du må lage en mekanisme som sikrer dette.» Full kvalitetsoffensiv godkjent; Spor 0 først, så grønt lys for skala (Spor 1–3). Dokumenteres skikkelig her; Voyage (`/trekplan` / `/trekexecute`) er foreslått motor for skala-fasen._ + +_Forutsetning: S1 de-risket judgen (v1 FAIL → v2 målrettet iterasjon GATE PASS, recall 84,2 % / presisjon 84,2 %). Grunnlag: `docs/ref-kb-workflow-plan-2026-06.md` (Fase 0–4 + roadmap), `docs/ref-kb-audit-2026-06.md`, `docs/ref-kb-direction-note-2026-06.md`._ + +--- + +## 1. Ærlig ramme (premisser programmet bygger på — ikke re-litiger) + +1. **«100 % til enhver tid» er en *prosess*-garanti, ikke en *øyeblikks*-garanti.** Microsoft endrer kildene kontinuerlig; ingen statisk fil kan være korrekt i evig tid. Den oppnåelige garantien er: *intet upekt/uverifisert innhold shipper, og enhver drift fanges innen én refresh-syklus.* Det er den operasjonelle definisjonen av «100 % til å stole på» (§4). +2. **De 38 kjente feilene er et utvalg, ikke fasiten.** Målt på 255 volatile påstander; base-rate 13,4 % ⇒ det fulle korpuset (~306 kildebelagte filer) har statistisk hundrevis av samme feilklasse vi ennå ikke har sett. Spor 0 fikser utvalget; Spor 1 avdekker resten korpus-vidt. +3. **Taket på én judge-runde er ~84 % recall.** Judgen er en høystakk-reduserer, ikke siste autoritet. Nær-100 % *fiks*-korrekthet oppnås av loopen (judge flagger → menneske bekrefter mot kilde → fiks), ikke av judgen alene. **Aldri auto-fiks.** +4. **Pris/unsourced er maskin-uverifiserbar** (74 % av pris; JS-rendrede Azure-sider). Disse merkes eksplisitt «ikke maskinverifiserbar» og forblir operatør-gated. Nær-100 %-målet gjelder den maskin-verifiserbare populasjonen (`sku/version/tpm/status/region/taxonomy`). + +## 2. Mål (suksesskriterium — måles mot brukerverdi) + +En bruker som chatter med pluginen får **korrekte, kilde-belagte MS-svar**, og mekanismen **holder det slik automatisk**: (a) flagget feilrate på maskin-verifiserbar populasjon < ~2 % målt på et *ferskt* gull-utvalg; (b) ingen `reference`-fil shipper uten kilde + verifiseringsdato; (c) drift fanges innen én KB-refresh-syklus; (d) pris/unsourced er ærlig merket og operatør-gated. + +## 3. De fire sporene + +### Spor 0 — Fiks de kjente 38 nå (judge-uavhengig, trygt) — STARTET +Fiks-manifest: `scripts/kb-eval/data/spor0-fix-manifest.json` (38 fikser, 25 filer, deterministisk fra gull-settet). Hver fiks har `reverify_required: true`. +- **Protokoll per fiks (ufravikelig):** (1) re-hent kilden (`microsoft_docs_fetch` på `source`) og bekreft korrekt verdi *live* (gull-`notes` er subagent-produsert — verifiseringsplikten krever fersk bekreftelse FØR en offentlig fil endres); (2) lokaliser den eksakte foreldede strengen i fila; (3) erstatt med kilde-bekreftet verdi; (4) sett `fixed: true` + `verified`-stempel. +- **Rydd tverteklyngene:** AI Search storage-tall er utdaterte *og* selvmotsigende på tvers av `rag-cost-optimization.md`, `embedding-models-selection.md`, `rag-query-cost-reduction.md`, `vector-storage-cost-optimization.md` — reconcile til én kilde-sann verdi. Samme for «Default/Enterprise → Quota Tiers»-omtalen (4 filer). +- **Kvalitets-disiplin:** kjøres i en *fokusert* sesjon (ikke som hale på en mettet kontekst) — offentlige filer for hele Norge tåler ikke hastverk. +- **Verifisering:** re-kjør judge på de 38 → alle `grounded`; storage-tall konsistente på tvers; suite grønn. + +### Spor 1 — Avdekk *hele* feilsettet korpus-vidt (S3-forutsetning + skalering) +- **Authority-backfill:** hver kildebelagt fil → sin autoritets-URL (recon: kun 3 URL-er har `authority_source` i dag — re-verifiseres mot `url-registry.json` FØR start). +- **Full frontmatter** (Fase 2 full): `type` / `source` / `verified` / `verified_by` per fil (OKF-kompatibel form). +- **Korpus-pass:** kjør v2-judgen over *alle* verifiserbare påstander i alle ~306 filer (ikke bare 255-utvalget). Output: komplett flagg-liste → mater Spor 0-protokollen korpus-vidt. +- **Kostnad (ærlig):** ~2700 ikke-batchbare `microsoft_docs_fetch` per full-pass — IKKE «$20–40 Batch». Flersesjons. +- **Verifisering:** hver ikke-advisor kildebelagt fil har `authority_source`; frontmatter validerer; flagg-lista persistert. + +### Spor 2 — Press pålitelighet mot 100 % (hardningen) +- **(a) Ensemble for recall:** union av N *diverse* judge-linser (f.eks. eksakt-verdi / strukturell / status-fokus). Mål single vs ensemble på gull-settet FØR adopsjon (operatørens «bygg begge og mål»). Union hever recall (mål: > 84,2 %), senker presisjon — tapet absorberes av menneske-i-loopen (c). Adopter kun hvis gull-målt forbedring. +- **(b) Gull-rekonsiliering:** løs hver judge-vs-gull-uenighet (v2: 6 FP + 6 FN) mot live kilde. Hver er enten judge-feil ELLER gull-feil; å løse dem kalibrerer judgen OG retter fasiten. (FP-ene inkluderer trolig diskutable gull-labels, f.eks. «100+» som nedre grense ble flagget — gull bør avgjøre om nedre-grense-påstander teller som feil.) Mål: 0 uløste uenigheter. +- **(c) Menneske-i-loopen fiks-protokoll:** judge flagger → operatør/ekspert bekrefter mot kilde → fiks + `verified`-bump. Garanterer ~100 % *fiks*-presisjon selv ved 84 % *judge*-presisjon. **Aldri auto-fiks.** +- **Verifisering:** ensemble P/R ≥ single på gull; 0 uløste judge-vs-gull-uenigheter; dokumentert at ingen fiks shippet uten menneske-bekreftelse. + +### Spor 3 — Mekanismen som holder det nær-100 % (Fase 4) — SE §4 +Create-time-guard + kadens-judge + rapporterende gulv + frontmatter-kontrakt. Detaljert under, fordi dette ER «mekanismen som sikrer dette». + +## 4. MEKANISMEN — «100 % til å stole på, til enhver tid» (operatørens kjernekrav) + +Garantien er en **invariant håndhevet av tre porter**, ikke et engangs-opprydding: + +> **Invariant:** Hver maskin-verifiserbar påstand i en `reference`-fil er bekreftet mot sin siterte kilde innen siste ``-vindu; intet `reference`-innhold shipper uten `source` + `verified`; drift flagges innen én refresh-syklus. + +**Port 1 — Frontmatter-kontrakt (tilstanden).** Hver fil bærer: +`type` (`reference|template|methodology|regulatory`) · `source` (autoritets-URL) · `verified` (dato sist bekreftet korrekt mot kilde) · `verified_by` (`judge-vN` / `human`). Template/methodology/regulatory er unntatt korrekthets-scope (skal ikke ha MS-`source`). + +**Port 2 — Create-time-guard (innløpet).** `scripts/kb-update/lib/transform.mjs` (`buildKbHeader`/`validateKbFile`) + `generate-skills`: +- Nekter å emitte en `reference`-fil uten `source`. +- Nytt/regenerert innhold kjøres gjennom judgen FØR commit → *født verifisert* (`verified=`, `verified_by=judge-vN`). Ellers re-introduserer neste KB-update driften (å øse en lekk båt). +- **Verifisering:** generator-test — `reference`-output har `source`+`verified`; mangler `source` ⇒ hard feil. + +**Port 3 — Kadens-judge (vedlikeholdet).** På KB-refresh-kadens (IKKE SessionStart — for dyrt): +- *Inkrementell:* re-judge filer hvis `source` sitemap_lastmod > `verified` (akkurat det staleness-loopen ser — billig, fanger lastmod-synlig drift). +- *Periodisk full-pass:* judge over hele korpuset (fanger den drift-klassen staleness bommer på — base-rate viste staleness-recall 0/40). +- Flagg → menneske-bekreft → fiks → `verified`-bump. **Rapporterende gulv** (Spor D peker: «N filer eldre enn X siden verified» / «M ubekreftede flagg»), ikke hard SessionStart-gate (unngå alarm-tretthet på et 84 %-signal). +- **Verifisering:** SessionStart surfacer trust-ferskhets-signal uten falske alarmer; operatør-waiver-sti finnes; CT5 (sourcedness) ERSTATTER K8s rolle. + +**Hvorfor dette gir «til enhver tid»:** du kan ikke garantere null drift i et øyeblikk (MS endrer ting når som helst), men du garanterer at (a) intet uverifisert shipper (Port 2), (b) tilstanden er eksplisitt og sporbar (Port 1), (c) drift fanges innen én syklus (Port 3). Det er den sterkeste ærlige garantien — og den er buildbar. + +## 5. Voyage-bruk (operatør: «kanskje bruke Voyage aktivt») + +- **Skala-fasen (Spor 1–3) er et lærebok-flersesjons-implementeringsløp** → `/trekplan` med dette dokumentet som brief gir en revidert, adversarielt gjennomgått implementeringsplan; `/trekexecute` kjører den på tvers av sesjoner med failure-recovery. +- **Spor 1 korpus-pass** kan dra nytte av Voyage-orkestrering (parallelle judge-agenter per fil, schema-validert output). +- **Spor 0** er lite nok til direkte utførelse (manifest finnes) — trenger ikke Voyage. +- **Ikke auto-lansert:** Voyage er tung maskineri; operatør kickstarter (`/trekbrief` el. `/trekplan --brief `). Anbefaling: kjør Spor 0 først, så `/trekplan` for Spor 1–3. + +## 6. Sekvensering + status (2026-06-26) + +| Spor | Status | Neste konkrete handling | +|---|---|---| +| S1 (de-risk) | ✅ FULLFØRT | — (v2 GATE PASS) | +| Spor 0 (fiks 38) | 🟡 STARTET (manifest klart) | Kjør manifest i fokusert sesjon m/ kilde-reverifisering | +| Spor 1 (korpus-skala) | ⏳ grønt lys | Authority-backfill + frontmatter → korpus-pass (Voyage `/trekplan`) | +| Spor 2 (hardning) | ⏳ grønt lys | Ensemble-måling på gull + gull-rekonsiliering | +| Spor 3 (mekanisme) | ⏳ grønt lys | Frontmatter-kontrakt → create-guard → kadens-judge (§4) | + +**Avhengigheter:** Spor 0 uavhengig (nå). Spor 3 Port 2 (create-guard) MÅ på plass før/sammen med korpus-fiksing (ellers reverserer generatoren). Spor 2b (gull-rekonsiliering) bør før Spor 1 korpus-pass (bunnsolid fasit før vi skalerer målingen). Advisor-filer koordineres mot Cosmo-utfasing (S-Cosmo). + +## 7. Verifisering — slik beviser vi «nær-100 %» (nordstjerne) +Etter Spor 0+1-fiksing: trekk et **NYTT, ferskt gull-utvalg** (friske påstander, ikke de vi fikset mot) og mål feilraten på maskin-verifiserbar populasjon → **mål < ~2 %**. Måling på den fikset-mot prøven er kontaminert; kun en fersk prøve beviser at korpuset faktisk er nær-100 %. Dette gull-utvalget blir også neste kalibreringssett for kadens-judgen. diff --git a/scripts/kb-eval/data/spor0-fix-manifest.json b/scripts/kb-eval/data/spor0-fix-manifest.json new file mode 100644 index 0000000..52f3eaf --- /dev/null +++ b/scripts/kb-eval/data/spor0-fix-manifest.json @@ -0,0 +1,505 @@ +{ + "_meta": { + "purpose": "Spor 0 fix work-list: confirmed content errors in reference files (gold outdated/wrong, volatile+fetchable). Each MUST be re-verified against the cited source before editing (verification duty), then fixed and fixed=true.", + "derived_from": "gold-correctness-set.json (frozen) + judge-bakeoff-results-v2.json", + "count": 38, + "files_touched": 25, + "note": "This is a SAMPLE of corpus errors (255 volatile claims). Spor 1 surfaces the full set corpus-wide." + }, + "fixes": [ + { + "id": "ms-ai-advisor/platforms/azure-ai-foundry.md#6", + "file": "skills/ms-ai-advisor/references/platforms/azure-ai-foundry.md", + "skill": "ms-ai-advisor", + "claim_type": "version", + "verdict": "outdated", + "wrong_assertion": "DeepSeek-R1-0528 Reasoning 131072 tokens", + "correction": "Fil 131072 vs kilde 163840. Trolig forvekslet med V3-familien.", + "source": "https://learn.microsoft.com/azure/foundry/foundry-models/concepts/models-sold-directly-by-azure", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-advisor/platforms/azure-ai-foundry.md#7", + "file": "skills/ms-ai-advisor/references/platforms/azure-ai-foundry.md", + "skill": "ms-ai-advisor", + "claim_type": "version", + "verdict": "outdated", + "wrong_assertion": "computer-use-preview (2025-03-11) via Responses API; 8192 kontekst, 1024 output; aka.ms/oai/cuaaccess", + "correction": "Computer Use bruker nå gpt-5.4-modell med computer-tool; URL og 8192/1024 avløst.", + "source": "https://learn.microsoft.com/azure/foundry-classic/openai/how-to/computer-use", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-advisor/platforms/model-catalog-2026.md#4", + "file": "skills/ms-ai-advisor/references/platforms/model-catalog-2026.md", + "skill": "ms-ai-advisor", + "claim_type": "tpm", + "verdict": "wrong", + "wrong_assertion": "DeepSeek-R1/V3 input/output-ratio 1 (standard, som input)", + "correction": "Fil: DeepSeek output-to-input-ratio = 1. Kilde: 4. Motsagt av kilden.", + "source": "https://learn.microsoft.com/azure/foundry/openai/how-to/provisioned-throughput-sizing", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-advisor/platforms/model-catalog-2026.md#6", + "file": "skills/ms-ai-advisor/references/platforms/model-catalog-2026.md", + "skill": "ms-ai-advisor", + "claim_type": "region", + "verdict": "outdated", + "wrong_assertion": "gpt-5.5 er eneste modell med Data Zone Standard (EU-residens) i Norway East", + "correction": "gpt-5.4 (2026-03-05) har OGSÅ Data Zone Standard i norwayeast. Tidsdrift.", + "source": "https://learn.microsoft.com/azure/foundry/foundry-models/concepts/models-sold-directly-by-azure-region-availability", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-advisor/platforms/model-catalog-2026.md#7", + "file": "skills/ms-ai-advisor/references/platforms/model-catalog-2026.md", + "skill": "ms-ai-advisor", + "claim_type": "status", + "verdict": "outdated", + "wrong_assertion": "gpt-5/gpt-5-codex/gpt-5-pro krever registrering aka.ms/oai/gpt5access", + "correction": "Kilde: tilgang ikke lenger begrenset. Tidsdrift.", + "source": "https://learn.microsoft.com/azure/foundry/openai/how-to/reasoning", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-advisor/prompt-engineering/chain-of-thought-prompting.md#3", + "file": "skills/ms-ai-advisor/references/prompt-engineering/chain-of-thought-prompting.md", + "skill": "ms-ai-advisor", + "claim_type": "taxonomy", + "verdict": "wrong", + "wrong_assertion": "reasoning_summary for GPT-5-serien støtter auto/concise/detailed", + "correction": "Kilden: GPT-5-serien støtter IKKE concise. Påstanden feil.", + "source": "https://learn.microsoft.com/azure/foundry/openai/how-to/reasoning", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-advisor/prompt-engineering/real-time-reasoning-performance.md#5", + "file": "skills/ms-ai-advisor/references/prompt-engineering/real-time-reasoning-performance.md", + "skill": "ms-ai-advisor", + "claim_type": "region", + "verdict": "outdated", + "wrong_assertion": "Realtime API regions: East US 2, Sweden Central (global)", + "correction": "Kilde: tilgjengelig for global deployments, ikke begrenset til de to. To-region-begrensning avløst.", + "source": "https://learn.microsoft.com/azure/foundry/openai/how-to/realtime-audio", + "v2_judge_caught": false, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-advisor/prompt-engineering/real-time-reasoning-performance.md#6", + "file": "skills/ms-ai-advisor/references/prompt-engineering/real-time-reasoning-performance.md", + "skill": "ms-ai-advisor", + "claim_type": "status", + "verdict": "outdated", + "wrong_assertion": "Realtime API fortsatt public preview (jan 2026); ikke SLA", + "correction": "Kilde: GA-endepunkt + GA-modeller. Kroppens preview-status foreldet (selvmotsigende med filens header).", + "source": "https://learn.microsoft.com/azure/foundry/openai/how-to/realtime-audio", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-advisor/prompt-engineering/reasoning-models-o1-o3-optimization.md#7", + "file": "skills/ms-ai-advisor/references/prompt-engineering/reasoning-models-o1-o3-optimization.md", + "skill": "ms-ai-advisor", + "claim_type": "status", + "verdict": "outdated", + "wrong_assertion": "Limited access for o3-pro/gpt-5-pro/gpt-5-codex via aka.ms-lenker", + "correction": "Kilde: tilgang ikke lenger begrenset. Tidsdrift.", + "source": "https://learn.microsoft.com/azure/foundry/openai/how-to/reasoning", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-engineering/azure-ai-services/ai-services-cost-optimization.md#5", + "file": "skills/ms-ai-engineering/references/azure-ai-services/ai-services-cost-optimization.md", + "skill": "ms-ai-engineering", + "claim_type": "taxonomy", + "verdict": "wrong", + "wrong_assertion": "Reservasjonsrabatt 1-års eller 3-års Azure Reservations", + "correction": "Kilde: 1-måned eller 1-år. Ingen 3-års term.", + "source": "https://learn.microsoft.com/azure/foundry/openai/concepts/provisioned-throughput-billing", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-engineering/azure-ai-services/ai-services-vs-foundry-tools-selection.md#3", + "file": "skills/ms-ai-engineering/references/azure-ai-services/ai-services-vs-foundry-tools-selection.md", + "skill": "ms-ai-engineering", + "claim_type": "version", + "verdict": "outdated", + "wrong_assertion": "Modellserie (2026-02): o4-mini topp-reasoning, o3, GPT-4o, GPT-3.5-Turbo, DALL-E 3, Whisper", + "correction": "Lineup headet av GPT-5.5/5.4/...+GPT-4.1; GPT-5.x/GPT-4.1 mangler, GPT-3.5-Turbo ikke lenger i highlights.", + "source": "https://learn.microsoft.com/azure/foundry/foundry-models/concepts/models-sold-directly-by-azure", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-engineering/azure-ai-services/ai-services-vs-foundry-tools-selection.md#5", + "file": "skills/ms-ai-engineering/references/azure-ai-services/ai-services-vs-foundry-tools-selection.md", + "skill": "ms-ai-engineering", + "claim_type": "sku", + "verdict": "outdated", + "wrong_assertion": "Model Catalog 100+ modeller", + "correction": "Kilde over 1900. '100+' grovt understated.", + "source": "https://learn.microsoft.com/azure/foundry/what-is-foundry", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-engineering/mlops-genaiops/genaiops-llm-specific-practices.md#2", + "file": "skills/ms-ai-engineering/references/mlops-genaiops/genaiops-llm-specific-practices.md", + "skill": "ms-ai-engineering", + "claim_type": "sku", + "verdict": "outdated", + "wrong_assertion": "Model Catalog 1600+ foundation models", + "correction": "Kilde over 1900. 1600+ utdatert lavere tall.", + "source": "https://learn.microsoft.com/azure/foundry/concepts/foundry-models-overview", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-engineering/mlops-genaiops/llm-evaluation-production.md#3", + "file": "skills/ms-ai-engineering/references/mlops-genaiops/llm-evaluation-production.md", + "skill": "ms-ai-engineering", + "claim_type": "sku", + "verdict": "outdated", + "wrong_assertion": "MLflow built-in judges inkluderer også Completeness, Fluency, Equivalence", + "correction": "Gjeldende Databricks-liste inneholder IKKE disse tre.", + "source": "https://learn.microsoft.com/azure/databricks/mlflow3/genai/eval-monitor/concepts/judges/", + "v2_judge_caught": false, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-engineering/mlops-genaiops/llm-evaluation-production.md#7", + "file": "skills/ms-ai-engineering/references/mlops-genaiops/llm-evaluation-production.md", + "skill": "ms-ai-engineering", + "claim_type": "version", + "verdict": "outdated", + "wrong_assertion": "Azure AI Evaluation SDK v1.14.0", + "correction": "Gjeldende v1.17.0.", + "source": "https://learn.microsoft.com/python/api/overview/azure/ai-evaluation-readme", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-engineering/rag-architecture/embedding-models-selection.md#6", + "file": "skills/ms-ai-engineering/references/rag-architecture/embedding-models-selection.md", + "skill": "ms-ai-engineering", + "claim_type": "sku", + "verdict": "wrong", + "wrong_assertion": "Azure AI Search Basic tier 1 GB storage", + "correction": "Kilde: Basic 15 GB (post-april) eller 2 GB (eldre). 1 GB var aldri Basic. Inkonsistent med rag-cost-optimization.md.", + "source": "https://learn.microsoft.com/azure/search/search-limits-quotas-capacity", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-engineering/rag-architecture/embedding-models-selection.md#7", + "file": "skills/ms-ai-engineering/references/rag-architecture/embedding-models-selection.md", + "skill": "ms-ai-engineering", + "claim_type": "sku", + "verdict": "outdated", + "wrong_assertion": "Standard S1 25 GB storage", + "correction": "S1 nå 160 GB per partisjon (nye services).", + "source": "https://learn.microsoft.com/azure/search/search-limits-quotas-capacity", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-engineering/rag-architecture/rag-context-windows.md#2", + "file": "skills/ms-ai-engineering/references/rag-architecture/rag-context-windows.md", + "skill": "ms-ai-engineering", + "claim_type": "version", + "verdict": "outdated", + "wrong_assertion": "GPT-4.1 series opp til 200k+ context window", + "correction": "Kilde ~1M. '200k+' understater grovt.", + "source": "https://learn.microsoft.com/azure/foundry/foundry-models/concepts/models-sold-directly-by-azure", + "v2_judge_caught": false, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-engineering/rag-architecture/rag-context-windows.md#3", + "file": "skills/ms-ai-engineering/references/rag-architecture/rag-context-windows.md", + "skill": "ms-ai-engineering", + "claim_type": "version", + "verdict": "wrong", + "wrong_assertion": "o3-mini 128k context window", + "correction": "Kilde: 200k input. o3-mini har 200k.", + "source": "https://learn.microsoft.com/azure/foundry/foundry-models/concepts/models-sold-directly-by-azure", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-engineering/rag-architecture/rag-context-windows.md#5", + "file": "skills/ms-ai-engineering/references/rag-architecture/rag-context-windows.md", + "skill": "ms-ai-engineering", + "claim_type": "taxonomy", + "verdict": "outdated", + "wrong_assertion": "TPM-tabell med Default tier / Enterprise tier-kolonner", + "correction": "Default/Enterprise erstattet av Quota Tiers (Tier 0-6).", + "source": "https://learn.microsoft.com/azure/foundry/openai/quotas-limits", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-engineering/rag-architecture/rag-cost-optimization.md#5", + "file": "skills/ms-ai-engineering/references/rag-architecture/rag-cost-optimization.md", + "skill": "ms-ai-engineering", + "claim_type": "sku", + "verdict": "outdated", + "wrong_assertion": "Per-partisjon storage S1 25/S2 100/S3 200/L1 1TB/L2 2TB", + "correction": "Fil-verdier pre-april-2024. Nye: S1 160/S2 512/S3 1024/L1 2048/L2 4096. Internt inkonsistent (Basic oppdatert, øvrige ikke).", + "source": "https://learn.microsoft.com/azure/search/search-limits-quotas-capacity", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-engineering/rag-architecture/rag-cost-optimization.md#6", + "file": "skills/ms-ai-engineering/references/rag-architecture/rag-cost-optimization.md", + "skill": "ms-ai-engineering", + "claim_type": "sku", + "verdict": "wrong", + "wrong_assertion": "Search Units L1 1-12, L2 1-12", + "correction": "Kilde: maks 36 SU for L1/L2. Forveksler partisjonstall med SU-maks.", + "source": "https://learn.microsoft.com/azure/search/search-limits-quotas-capacity", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-governance/monitoring-observability/endpoint-health-and-capacity-planning.md#2", + "file": "skills/ms-ai-governance/references/monitoring-observability/endpoint-health-and-capacity-planning.md", + "skill": "ms-ai-governance", + "claim_type": "taxonomy", + "verdict": "outdated", + "wrong_assertion": "Metrikker PTUUtilization, ProcessingTime, TokensGenerated", + "correction": "Finnes ikke som REST-navn. Faktisk: AzureOpenAIProvisionedManagedUtilizationV2, AzureOpenAITimeToResponse, GeneratedTokens. Metrikknavn drift.", + "source": "https://learn.microsoft.com/azure/azure-monitor/reference/supported-metrics/microsoft-cognitiveservices-accounts-metrics", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-governance/monitoring-observability/endpoint-health-and-capacity-planning.md#3", + "file": "skills/ms-ai-governance/references/monitoring-observability/endpoint-health-and-capacity-planning.md", + "skill": "ms-ai-governance", + "claim_type": "tpm", + "verdict": "outdated", + "wrong_assertion": "RPM/TPM per 1 Unit Capacity: eldre chat 6/1000; o1 1/6000; o3 1/1000; o3-mini 1/10000", + "correction": "1 Unit Capacity-modellen erstattet av Quota Tiers (Tier 0-6). Ratioene holder, rammeverket avløst.", + "source": "https://learn.microsoft.com/azure/foundry/openai/quotas-limits", + "v2_judge_caught": false, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-governance/monitoring-observability/token-usage-tracking-attribution.md#3", + "file": "skills/ms-ai-governance/references/monitoring-observability/token-usage-tracking-attribution.md", + "skill": "ms-ai-governance", + "claim_type": "taxonomy", + "verdict": "outdated", + "wrong_assertion": "Metrikker PromptTokens (input) og CompletionTokens (output)", + "correction": "Finnes ikke som REST-navn. Faktisk: ProcessedPromptTokens/InputTokens og GeneratedTokens/OutputTokens. Drift.", + "source": "https://learn.microsoft.com/azure/azure-monitor/reference/supported-metrics/microsoft-cognitiveservices-accounts-metrics", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-governance/responsible-ai/responsible-ai-training-awareness.md#2", + "file": "skills/ms-ai-governance/references/responsible-ai/responsible-ai-training-awareness.md", + "skill": "ms-ai-governance", + "claim_type": "status", + "verdict": "wrong", + "wrong_assertion": "AI-cert (AI-900, AI-102) har ikke formell utløpsdato", + "correction": "AI-102 har Renewal Frequency 12 mnd OG retires 2026-06-30. Kun AI-900 utløper ikke; å lumpe AI-102 inn er feil.", + "source": "https://learn.microsoft.com/credentials/certifications/azure-ai-engineer", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-governance/responsible-ai/stakeholder-communication-ai-decisions.md#3", + "file": "skills/ms-ai-governance/references/responsible-ai/stakeholder-communication-ai-decisions.md", + "skill": "ms-ai-governance", + "claim_type": "taxonomy", + "verdict": "outdated", + "wrong_assertion": "Copilot Studio inkluderer 25000 messages", + "correction": "Kvantum 25000 korrekt, men enheten messages avløst av Copilot Credits (2025-09-01).", + "source": "https://learn.microsoft.com/microsoft-365/copilot/pay-as-you-go/copilot-capacity-packs", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-infrastructure/bcdr/ai-foundry-disaster-recovery-planning.md#8", + "file": "skills/ms-ai-infrastructure/references/bcdr/ai-foundry-disaster-recovery-planning.md", + "skill": "ms-ai-infrastructure", + "claim_type": "taxonomy", + "verdict": "wrong", + "wrong_assertion": "Microsoft Foundry tidligere Azure AI Studio / Azure Machine Learning", + "correction": "Brand-evolusjon: Azure AI Studio -> Azure AI Foundry -> Microsoft Foundry. Azure ML er IKKE tidligere navn (egen tjeneste). Konflatering feil.", + "source": "https://learn.microsoft.com/azure/foundry/what-is-foundry", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-infrastructure/bcdr/capacity-planning-dr-configurations.md#3", + "file": "skills/ms-ai-infrastructure/references/bcdr/capacity-planning-dr-configurations.md", + "skill": "ms-ai-infrastructure", + "claim_type": "status", + "verdict": "wrong", + "wrong_assertion": "AI Search 2 vs 3 replikaer: 99.9% vs 99.99% SLA", + "correction": "AI Search SLA er 99.9%, ingen 99.99%-nivå. 2 vs 3 = lese vs lese-skrive, ikke 99.9 vs 99.99. Aldri korrekt.", + "source": "https://learn.microsoft.com/azure/reliability/reliability-ai-search", + "v2_judge_caught": false, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-infrastructure/bcdr/network-resilience-patterns-ai.md#1", + "file": "skills/ms-ai-infrastructure/references/bcdr/network-resilience-patterns-ai.md", + "skill": "ms-ai-infrastructure", + "claim_type": "taxonomy", + "verdict": "outdated", + "wrong_assertion": "Azure Front Door DDoS Protection Standard", + "correction": "Gjeldende navn: DDoS Network Protection / DDoS IP Protection. 'Standard'-navnet avløst.", + "source": "https://learn.microsoft.com/azure/ddos-protection/ddos-protection-overview", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-security/cost-optimization/azure-ai-foundry-cost-governance.md#6", + "file": "skills/ms-ai-security/references/cost-optimization/azure-ai-foundry-cost-governance.md", + "skill": "ms-ai-security", + "claim_type": "tpm", + "verdict": "outdated", + "wrong_assertion": "Model Quota (TPM) varierer per tier 150K-30M", + "correction": "Nå Quota Tiers (Free + Tier 1-6) opp til 225M. 150K-30M foreldet.", + "source": "https://learn.microsoft.com/azure/foundry/openai/quotas-limits", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-security/cost-optimization/model-selection-price-performance.md#8", + "file": "skills/ms-ai-security/references/cost-optimization/model-selection-price-performance.md", + "skill": "ms-ai-security", + "claim_type": "status", + "verdict": "outdated", + "wrong_assertion": "Model Router er GA-funksjonalitet i Microsoft Foundry", + "correction": "Kilde lenker 'model router for Foundry (preview)'. Fortsatt preview, ikke GA.", + "source": "https://learn.microsoft.com/azure/foundry/foundry-models/how-to/model-choice-guide", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-security/cost-optimization/model-selection-price-performance.md#9", + "file": "skills/ms-ai-security/references/cost-optimization/model-selection-price-performance.md", + "skill": "ms-ai-security", + "claim_type": "version", + "verdict": "outdated", + "wrong_assertion": "AI Builder default GPT-4o-mini for generative (per des 2024)", + "correction": "Default nå GPT-4.1 mini; GPT-4o/4o-mini kun US government. Utdatert.", + "source": "https://learn.microsoft.com/microsoft-copilot-studio/prompt-model-settings", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-security/cost-optimization/multi-model-strategy-costs.md#2", + "file": "skills/ms-ai-security/references/cost-optimization/multi-model-strategy-costs.md", + "skill": "ms-ai-security", + "claim_type": "taxonomy", + "verdict": "outdated", + "wrong_assertion": "opptil 18 underliggende modeller", + "correction": "2025-11-18 lister nå ~28 modeller. 18 foreldet (in-place oppdatering).", + "source": "https://learn.microsoft.com/azure/foundry/openai/concepts/model-router", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-security/cost-optimization/multi-model-strategy-costs.md#3", + "file": "skills/ms-ai-security/references/cost-optimization/multi-model-strategy-costs.md", + "skill": "ms-ai-security", + "claim_type": "tpm", + "verdict": "outdated", + "wrong_assertion": "Rate limits Default/Enterprise GlobalStandard 250/250000, Enterprise 400/400000; DataZone 150/150000", + "correction": "Nå tier-basert (Tier 1-6). Default/Enterprise-struktur erstattet av Quota Tiers.", + "source": "https://learn.microsoft.com/azure/foundry/openai/concepts/model-router", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-security/cost-optimization/rag-query-cost-reduction.md#2", + "file": "skills/ms-ai-security/references/cost-optimization/rag-query-cost-reduction.md", + "skill": "ms-ai-security", + "claim_type": "sku", + "verdict": "outdated", + "wrong_assertion": "AI Search tier storage Basic 2/S1 25/S2 100/S3 200 GB per partisjon", + "correction": "Pre-april-2024-tall. Nye: Basic 15/S1 160/S2 512/S3 1024.", + "source": "https://learn.microsoft.com/azure/search/search-limits-quotas-capacity", + "v2_judge_caught": false, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-security/cost-optimization/reserved-capacity-planning.md#6", + "file": "skills/ms-ai-security/references/cost-optimization/reserved-capacity-planning.md", + "skill": "ms-ai-security", + "claim_type": "status", + "verdict": "wrong", + "wrong_assertion": "Autorenew ON som standard for nye reservasjoner (etter 2025-Q4)", + "correction": "Kilde: auto-renewal opt-in; for replacement auto-renew av som standard. Motsier 'ON som standard'.", + "source": "https://learn.microsoft.com/azure/cost-management-billing/reservations/azure-openai", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + }, + { + "id": "ms-ai-security/cost-optimization/vector-storage-cost-optimization.md#5", + "file": "skills/ms-ai-security/references/cost-optimization/vector-storage-cost-optimization.md", + "skill": "ms-ai-security", + "claim_type": "tpm", + "verdict": "outdated", + "wrong_assertion": "Vector quota (post-April 2024) Basic 1/S1 12/S2 36/S3 72 GB", + "correction": "Post-April-2024 vektorkvote er 5/35/150/300 GB. Fil-tall tilsvarer eldre juli-2023-periode.", + "source": "https://learn.microsoft.com/azure/search/search-limits-quotas-capacity", + "v2_judge_caught": true, + "reverify_required": true, + "fixed": false + } + ] +}