ms-ai-architect/scripts/kb-eval/data
Kjell Tore Guttormsen b57114746a feat(ms-ai-architect): #33 ratifisert — ankeret var renvasket, containeren var defekten, og sveip-eksponeringen var 1 streng ikke alle [skip-docs]
idx-26i lukket. Entryen bokfoerte seg selv som UMAALT kandidat og krevde to
avgjoerelser. Begge snudde under maaling, i motsatt retning av det entryen antok.

KORPUS-HALVDELEN — ANKERET ER RENVASKET, IKKE REPARERT.
1) Stempel-dekning maalt FOERST (#29-disiplinen): fila har NULL
   "**Confidence:**"-stempler. idx-26f sin defektklasse - uhjemlet spesifisitet
   UNDER et verifiseringsmerke, der defekten er merkets rekkevidde og ikke
   setningen - overfoeres derfor ikke. Det finnes ikke noe merke her aa
   overskride. Fila sitt eneste verifiseringsartefakt er footer-paret
   "Verification status: Alle kilder verifisert 2026-02", en datert paastand om
   KILDELISTA, ikke om enkeltpaastander.
2) Parentesen er ORDRETT TRO mot fila sin EGEN oppgitte kilde.
   concept-responsible-ai staar i fila sin "Microsoft kilder" og sier:
   "assess model fairness across sensitive groups, such as gender, ethnicity,
   age, and other characteristics". idx-26f sin soesterdefekt fantes fordi
   SCORECARD-sida bare sier "your desired sensitive groups"; denne fila
   attribuerer til en ANNEN side som faktisk oppgir de tre. Samme streng, ulik
   kilde, motsatt dom - og nettopp derfor kunne et sveip paa STRENGEN aldri ha
   adjudisert dette.

DEFEKTEN ER CONTAINEREN. Alle fire punktene verifisert mot levende kilde:
fairness assessment (concept-responsible-ai, ordrett) · explainability, inkl.
SHAP (how-to-machine-learning-interpretability: RAI dashboard bruker "LightGBM
paired with the SHAP (SHapley Additive exPlanations) Tree Explainer") · error
analysis ("cohorts with a higher error rate than the overall benchmark") ·
model monitoring ("data drift detection", under Accountability/MLOps). Alle
fire er AZURE MACHINE LEARNING. Overskriften sa Microsoft Foundry. Levende
Foundry-RAI-flate (responsible-use-of-ai-overview, hentet denne oekten) er
Discover/Protect/Govern med content filters, Guardrails, tracing og Defender-
varsler - ingen av de fire. Korpuset sier dette selv i
responsible-ai-training-awareness.md:280, saa fila motsa en soesterfil.

KLASSE-KORREKSJON: kryss-attribusjon (idx-26b sin klasse), ikke "replacement".
Entryens eget forbehold navnga den ekte defekten, men behandlet den som grunnen
til at ankeret kanskje var USKYLDIG - ikke som funnet selv.

OPPHAV MAALT, IKKE ANTATT. "git log -S" peker paa 03d596e (Foundry-navnesveipen
over 233 filer), men 03d596e^ viser at overskriften da sto som "### Azure AI
Foundry RAI-tools:". Sveipen fulgte sin egen oppgitte regel; feilattribusjonen
er eldre og ble bare baaret videre under nytt produktnavn. En mekanisk sveip er
ikke skyldig bare fordi git blame stopper der.

FORM: overskriften retarget til "### Azure Machine Learning RAI-verktoey:"
(korrekte norske diakritiske tegn i korpusfila; previewet var ASCII-sikret og
LABELEN er det ratifiserte objektet). Punktene uroert, fila fortsatt 314 linjer.
Overskriften ligger bevisst paa AZURE MACHINE LEARNING-niva og IKKE paa
"Responsible AI Dashboard"-niva: punkt 4 er MLOps, ikke en dashboard-komponent,
saa en Dashboard-overskrift ville latt reparasjonen ARVE kryss-attribusjons-
klassen den er skrevet for aa fjerne. Naboblokka lest om igjen HEL etter editen:
l.234 baerer allerede "Azure Machine Learning Responsible AI Dashboard", saa de
to blokkene leser naa som oversikt-saa-detalj paa ETT produkt.

KONVENSJONS-HALVDELEN — ENTRYENS EGET OMFANGS-PREMISS VAR USANT.
Entryen paastod at "every cross-file sweep recorded in this queue that greped
English strings alone has an unmeasured Norwegian half". Maalt: av 52 resolved
har bare 4 noe sveip-utsagn, og 2 av dem er ikke literale sveip - idx-26e sitt
er en MERKNAD om framtidige sveip, og idx-26d kjoerte en konsept-sjekk som
faktisk FANT kryss-fil-instansene og bokfoerte idx-26e ut av dem. Reell
eksponering: 2 entries, 4 strenger. Alle fire norske halvdeler kjoert:
"Powered by AI" 0 · "outlier analysis" 0 · "Dataset statistics" 0 ·
"gender, ethnicity, age" 7. Én streng av fire, i én entry av to.

OG DE 7 TREFFENE BAERER IKKE EN BLANK REGEL: fem er alminnelig fagprosa uten
produktattribusjon (diskrimineringslov, bias-testing, sjekklister). Bare to er
produktpaastander: dette ankeret, og responsible-ai-framework-overview.md:41 -
som attribuerer KORREKT til "Fairness assessment i RAI Dashboard". Den fila er
KONTROLLEN: den viser at den norske frasen ikke selv er en defektmarkoer, og at
denne fila var avviket og ikke moensteret. Et blankt tospraaklig sveip ville
kjoert paa 1/7 presisjon. Det ble lagt fram med den maalte presisjonen og
avslaatt; den filtrerte formen ble ratifisert som #33.

#33 KJOERT MOT EGEN REPARASJON: to andre steder nevner Foundry og RAI Dashboard
sammen (ai-act-microsoft-tools-mapping.md:33, responsible-ai-framework-
overview.md:188) - begge skiller dem eksplisitt og er korrekt attribuert.
Klassen er lukket paa én instans.

Historisk eksponering er LUKKET, ikke etterlatt aapen: alle fire tidligere
sveipede strenger har faatt sin norske halvdel maalt denne oekten.

Hel-linje-bevis: l.236 eksakt ny overskrift, l.237 anker uendret, 0 filer med
gammel streng. Suite 1052/1052. check-g7-queue exit 0. Koea: 58 entries
(5 aapne, 53 resolved), 13 former (#21-#33). Alle 13 GOVERNS-pekere opploeser
mot eksisterende, resolvede entries (skript-verifisert, ikke haand-talt).

[skip-docs]: ren KB-korrektur, ingen endring i kommandoer/agenter/skills/hooks.
2026-08-13 22:47:39 +02:00
..
fase0-returns feat(ms-ai-architect): Fase 0 steg 2 — verifiserings-fan-out (373 påstander) + gull-sett m/ deterministisk lastmod-join + TDD [skip-docs] 2026-06-26 15:16:10 +02:00
r11-o2-returns feat(ms-ai-architect): R11 §10 måling #2 bølge 2 — alle 46 R8-enumerasjoner klassifisert [skip-docs] 2026-08-03 17:36:29 +02:00
base-rate-report.json feat(ms-ai-architect): Fase 0 steg 3 — base-rate-rapport + GATE: BYGG Fase 3 (scoped/hybrid) [skip-docs] 2026-06-26 17:15:54 +02:00
base-rate-report.md feat(ms-ai-architect): Fase 0 steg 3 — base-rate-rapport + GATE: BYGG Fase 3 (scoped/hybrid) [skip-docs] 2026-06-26 17:15:54 +02:00
eval-baseline.json feat(ms-ai-architect): Sesjon 15 — B2 K10 søsken-scope-ikke-overlapp 2026-06-20 11:59:59 +02:00
fase0-sample-frame.json feat(ms-ai-architect): Fase 0 steg 1 — deterministisk sample-frame (45 volatil + 10 kontroll) + TDD [skip-docs] 2026-06-26 14:18:53 +02:00
g7-review-queue.json feat(ms-ai-architect): #33 ratifisert — ankeret var renvasket, containeren var defekten, og sveip-eksponeringen var 1 streng ikke alle [skip-docs] 2026-08-13 22:47:39 +02:00
gold-correctness-set.json feat(ms-ai-architect): G5b gull-friskhets-spot-sjekk LUKKET — 4 v3-FP re-adjudert mot live, ALLE stale gull (v3 flagget korrekt), baseline løftet v3 P89.7/R92.1 → P100/R92.9/0FP; v3.1 forfattet (ren recall-hardning, FP-vakt droppet) [skip-docs] 2026-06-30 13:43:52 +02:00
judge-bakeoff-claims.json feat(ms-ai-architect): S1 judge bake-off harness + forhåndsregistrert gate (TDD) [skip-docs] 2026-06-26 20:10:58 +02:00
judge-bakeoff-report-v2-g5bgold.json feat(ms-ai-architect): G5b gull-friskhets-spot-sjekk LUKKET — 4 v3-FP re-adjudert mot live, ALLE stale gull (v3 flagget korrekt), baseline løftet v3 P89.7/R92.1 → P100/R92.9/0FP; v3.1 forfattet (ren recall-hardning, FP-vakt droppet) [skip-docs] 2026-06-30 13:43:52 +02:00
judge-bakeoff-report-v2-g5bgold.md feat(ms-ai-architect): G5b gull-friskhets-spot-sjekk LUKKET — 4 v3-FP re-adjudert mot live, ALLE stale gull (v3 flagget korrekt), baseline løftet v3 P89.7/R92.1 → P100/R92.9/0FP; v3.1 forfattet (ren recall-hardning, FP-vakt droppet) [skip-docs] 2026-06-30 13:43:52 +02:00
judge-bakeoff-report-v2-g5gold.json feat(ms-ai-architect): G5 gull-friskhets-mikropass LUKKET — 2 gull-feil rettet (genaiops#2, model-selection#8), v3 REHABILITERT — slår v2 på fersk gull (P 89.7/R 92.1 vs 86.8/86.8); adopsjonsbeslutning reversert [skip-docs] 2026-06-30 11:21:45 +02:00
judge-bakeoff-report-v2-g5gold.md feat(ms-ai-architect): G5 gull-friskhets-mikropass LUKKET — 2 gull-feil rettet (genaiops#2, model-selection#8), v3 REHABILITERT — slår v2 på fersk gull (P 89.7/R 92.1 vs 86.8/86.8); adopsjonsbeslutning reversert [skip-docs] 2026-06-30 11:21:45 +02:00
judge-bakeoff-report-v2-reconciled.json feat(ms-ai-architect): Spor 2b gull-rekonsiliering — 12 uenigheter løst, fasit herdet (P 84→92%, R 84→88%) [skip-docs] 2026-06-30 07:20:21 +02:00
judge-bakeoff-report-v2-reconciled.md feat(ms-ai-architect): Spor 2b gull-rekonsiliering — 12 uenigheter løst, fasit herdet (P 84→92%, R 84→88%) [skip-docs] 2026-06-30 07:20:21 +02:00
judge-bakeoff-report-v2.json feat(ms-ai-architect): S1 v2 targeted iteration — GATE PASS (recall 84.2%, precision 84.2%) [skip-docs] 2026-06-26 21:23:50 +02:00
judge-bakeoff-report-v2.md feat(ms-ai-architect): S1 v2 targeted iteration — GATE PASS (recall 84.2%, precision 84.2%) [skip-docs] 2026-06-26 21:23:50 +02:00
judge-bakeoff-report-v3-g5bgold.json feat(ms-ai-architect): G5b gull-friskhets-spot-sjekk LUKKET — 4 v3-FP re-adjudert mot live, ALLE stale gull (v3 flagget korrekt), baseline løftet v3 P89.7/R92.1 → P100/R92.9/0FP; v3.1 forfattet (ren recall-hardning, FP-vakt droppet) [skip-docs] 2026-06-30 13:43:52 +02:00
judge-bakeoff-report-v3-g5bgold.md feat(ms-ai-architect): G5b gull-friskhets-spot-sjekk LUKKET — 4 v3-FP re-adjudert mot live, ALLE stale gull (v3 flagget korrekt), baseline løftet v3 P89.7/R92.1 → P100/R92.9/0FP; v3.1 forfattet (ren recall-hardning, FP-vakt droppet) [skip-docs] 2026-06-30 13:43:52 +02:00
judge-bakeoff-report-v3-g5gold.json feat(ms-ai-architect): G5 gull-friskhets-mikropass LUKKET — 2 gull-feil rettet (genaiops#2, model-selection#8), v3 REHABILITERT — slår v2 på fersk gull (P 89.7/R 92.1 vs 86.8/86.8); adopsjonsbeslutning reversert [skip-docs] 2026-06-30 11:21:45 +02:00
judge-bakeoff-report-v3-g5gold.md feat(ms-ai-architect): G5 gull-friskhets-mikropass LUKKET — 2 gull-feil rettet (genaiops#2, model-selection#8), v3 REHABILITERT — slår v2 på fersk gull (P 89.7/R 92.1 vs 86.8/86.8); adopsjonsbeslutning reversert [skip-docs] 2026-06-30 11:21:45 +02:00
judge-bakeoff-report-v3.1.json feat(ms-ai-architect): G1 LUKKET — v3.1 judge MÅLT + ADOPTERT (P100/R100/0FP/0FN, max-utfall) 2026-06-30 21:33:45 +02:00
judge-bakeoff-report-v3.1.md feat(ms-ai-architect): G1 LUKKET — v3.1 judge MÅLT + ADOPTERT (P100/R100/0FP/0FN, max-utfall) 2026-06-30 21:33:45 +02:00
judge-bakeoff-report-v3.json feat(ms-ai-architect): G1 v3 bake-off MÅLT — v3 regredierte (P 92.1→89.7, R flat), v2 beholdt; G5 gull-friskhet åpnet [skip-docs] 2026-06-30 10:54:39 +02:00
judge-bakeoff-report-v3.md feat(ms-ai-architect): G1 v3 bake-off MÅLT — v3 regredierte (P 92.1→89.7, R flat), v2 beholdt; G5 gull-friskhet åpnet [skip-docs] 2026-06-30 10:54:39 +02:00
judge-bakeoff-report.json feat(ms-ai-architect): S1 judge bake-off RESULT — GATE FAIL (recall 68.4% < 80%) [skip-docs] 2026-06-26 20:45:09 +02:00
judge-bakeoff-report.md feat(ms-ai-architect): S1 judge bake-off RESULT — GATE FAIL (recall 68.4% < 80%) [skip-docs] 2026-06-26 20:45:09 +02:00
judge-bakeoff-results-v2.json feat(ms-ai-architect): S1 v2 targeted iteration — GATE PASS (recall 84.2%, precision 84.2%) [skip-docs] 2026-06-26 21:23:50 +02:00
judge-bakeoff-results-v3.1.json feat(ms-ai-architect): G1 LUKKET — v3.1 judge MÅLT + ADOPTERT (P100/R100/0FP/0FN, max-utfall) 2026-06-30 21:33:45 +02:00
judge-bakeoff-results-v3.json feat(ms-ai-architect): G1 v3 bake-off MÅLT — v3 regredierte (P 92.1→89.7, R flat), v2 beholdt; G5 gull-friskhet åpnet [skip-docs] 2026-06-30 10:54:39 +02:00
judge-bakeoff-results.json feat(ms-ai-architect): S1 judge bake-off RESULT — GATE FAIL (recall 68.4% < 80%) [skip-docs] 2026-06-26 20:45:09 +02:00
judge-pass-manifest.json feat(ms-ai-architect): R7.5 KOMPLETT 51/51 — payload-31..51 dømt+ingestet, re-judge-gate bestått, async-processing stemplet [skip-docs] 2026-08-03 15:56:52 +02:00
judge-results.json feat(ms-ai-architect): Spor D steg A — eng+infra K10-fix → korpus-invariant ≥90 oppfylt 2026-06-23 17:56:43 +02:00
k1-trigger-prompts.json fix(ms-ai-architect): Sesjon 11 — K1 trigger-presisjon, blindet judge PASS alle 5 2026-06-20 10:00:47 +02:00
r11-footer-class-2026-08-11.json docs(ms-ai-architect): footer-klassen handklassifisert — 58 medlemmer, en fjerde unnslippsform, og «alle avvik samme vei» falt 2026-08-11 21:52:19 +02:00
r11-pilot-classification.json fix(ms-ai-architect): 58-klassen er lukket — og den siste keep-linja var usann 2026-08-12 20:16:46 +02:00
r71-payloads.json feat(ms-ai-architect): R7.1 — judge-pass 30/45 filer (362/544 claims; 1 pass, 29 flagged, 106 flagg; v3.1-judge, ledger durabel per fil) [skip-docs] 2026-07-18 17:34:49 +02:00
r72-payloads.json fix(ms-ai-architect): 58-klassen er lukket — og den siste keep-linja var usann 2026-08-12 20:16:46 +02:00
r73-payloads.json fix(ms-ai-architect): 58-klassen er lukket — og den siste keep-linja var usann 2026-08-12 20:16:46 +02:00
r74-payloads.json fix(ms-ai-architect): 58-klassen er lukket — og den siste keep-linja var usann 2026-08-12 20:16:46 +02:00
r75-payloads.json fix(ms-ai-architect): 58-klassen er lukket — og den siste keep-linja var usann 2026-08-12 20:16:46 +02:00
spor0-fix-manifest.json fix(ms-ai-architect): R5 G5b — 4 innholds-fikser (retired gpt-35-turbo→gpt-4o-mini, vector-quant GA 2024-07-01, 2 overclaims nyansert), hver live-verifisert per MS Learn-kilde [skip-docs] 2026-07-04 17:09:23 +02:00