ms-ai-architect/scripts/kb-eval/data
Kjell Tore Guttormsen 41f769a166 docs(ms-ai-architect): footer-klassen handklassifisert — 58 medlemmer, en fjerde unnslippsform, og «alle avvik samme vei» falt
§9.16. Leveransen er en maaling og en scope-anbefaling for aapent spoersmaal
#17; ingen korpusfil er roert.

«>=48» var riktig som gulv. Handklassifisert: 58 ekte medlemmer i 58 filer.
Bøtter: 30 konsistent / 11 inkonsistent / 1 tvetydig / 16 ikke sjekkbar.
Hvert anker verifisert ordrett og unikt (0 avvik).

FJERDE UNNSLIPPSFORM: tellingen baaret av handlingsordet («3 soek»,
«4 search queries», «2 deep fetch»), ikke av «kall». Mitt eget nett var blindt
for den — domain-specific-prompt-optimization.md:589 ble kun reddet av
nabolinja, og model-versioning-registry-management.md var usynlig i sin helhet
for baade MCP- og verktoeynavn-nettet.

COMPLETENESS: i stedet for flere ordgjetninger ble hele etikettvokabularet i
proveniensblokkene enumerert — 68 distinkte etiketter / 141 linjer, alle
plasserbare i kall-telling, kilde-telling eller annet. Ingen femte form.
Den kjente residualen (alle nett krever et SIFFER) ble testet, ikke antatt:
21 tallord-treff, alle broedtekst, null medlemmer.

RETNINGSARGUMENTET RE-MAALT: 10 av 11 inkonsistente gaar oppgitt < sum, 1 gaar
motsatt (chain-of-thought-prompting.md, oppgitt 4 over enumerert 3). «Alle
avvik gaar samme vei» er falsifisert som absolutt og maa slutte aa siteres
slik; tendensen (91 %) overlever. «Null motsatt» var et artefakt av at
populasjonen var maalt til under halv stoerrelse.

FORMEN DEKKER IKKE KLASSEN: 46 av 58 er linjeform, 12 er blokkform der «slett
linja» er udefinert — og én blokk blander naboklassen (Unique sources) inn i
samme punktliste som kall-linjene.

ANBEFALING #17: én klasse-entry for de 42 uten aapen beslutning, 16 egne
entries for dem som baerer én. Beslutning #14 («én entry per fil») ble tatt da
klassen ble antatt aa vaere 14 filer; 42 nesten-identiske entries er nettopp
mekanismen §9.15 viste at lot en feilmaaling gjemme seg bak sine egne kopier.

Datasett: scripts/kb-eval/data/r11-footer-class-2026-08-11.json
Suite 1047/1047.
2026-08-11 21:52:19 +02:00
..
fase0-returns feat(ms-ai-architect): Fase 0 steg 2 — verifiserings-fan-out (373 påstander) + gull-sett m/ deterministisk lastmod-join + TDD [skip-docs] 2026-06-26 15:16:10 +02:00
r11-o2-returns feat(ms-ai-architect): R11 §10 måling #2 bølge 2 — alle 46 R8-enumerasjoner klassifisert [skip-docs] 2026-08-03 17:36:29 +02:00
base-rate-report.json feat(ms-ai-architect): Fase 0 steg 3 — base-rate-rapport + GATE: BYGG Fase 3 (scoped/hybrid) [skip-docs] 2026-06-26 17:15:54 +02:00
base-rate-report.md feat(ms-ai-architect): Fase 0 steg 3 — base-rate-rapport + GATE: BYGG Fase 3 (scoped/hybrid) [skip-docs] 2026-06-26 17:15:54 +02:00
eval-baseline.json feat(ms-ai-architect): Sesjon 15 — B2 K10 søsken-scope-ikke-overlapp 2026-06-20 11:59:59 +02:00
fase0-sample-frame.json feat(ms-ai-architect): Fase 0 steg 1 — deterministisk sample-frame (45 volatil + 10 kontroll) + TDD [skip-docs] 2026-06-26 14:18:53 +02:00
g7-review-queue.json fix(ms-ai-architect): §9.15-rettelse — «45» var et gulv, og min egen sveip bar defekten den nettopp navnga 2026-08-09 14:51:05 +02:00
gold-correctness-set.json feat(ms-ai-architect): G5b gull-friskhets-spot-sjekk LUKKET — 4 v3-FP re-adjudert mot live, ALLE stale gull (v3 flagget korrekt), baseline løftet v3 P89.7/R92.1 → P100/R92.9/0FP; v3.1 forfattet (ren recall-hardning, FP-vakt droppet) [skip-docs] 2026-06-30 13:43:52 +02:00
judge-bakeoff-claims.json feat(ms-ai-architect): S1 judge bake-off harness + forhåndsregistrert gate (TDD) [skip-docs] 2026-06-26 20:10:58 +02:00
judge-bakeoff-report-v2-g5bgold.json feat(ms-ai-architect): G5b gull-friskhets-spot-sjekk LUKKET — 4 v3-FP re-adjudert mot live, ALLE stale gull (v3 flagget korrekt), baseline løftet v3 P89.7/R92.1 → P100/R92.9/0FP; v3.1 forfattet (ren recall-hardning, FP-vakt droppet) [skip-docs] 2026-06-30 13:43:52 +02:00
judge-bakeoff-report-v2-g5bgold.md feat(ms-ai-architect): G5b gull-friskhets-spot-sjekk LUKKET — 4 v3-FP re-adjudert mot live, ALLE stale gull (v3 flagget korrekt), baseline løftet v3 P89.7/R92.1 → P100/R92.9/0FP; v3.1 forfattet (ren recall-hardning, FP-vakt droppet) [skip-docs] 2026-06-30 13:43:52 +02:00
judge-bakeoff-report-v2-g5gold.json feat(ms-ai-architect): G5 gull-friskhets-mikropass LUKKET — 2 gull-feil rettet (genaiops#2, model-selection#8), v3 REHABILITERT — slår v2 på fersk gull (P 89.7/R 92.1 vs 86.8/86.8); adopsjonsbeslutning reversert [skip-docs] 2026-06-30 11:21:45 +02:00
judge-bakeoff-report-v2-g5gold.md feat(ms-ai-architect): G5 gull-friskhets-mikropass LUKKET — 2 gull-feil rettet (genaiops#2, model-selection#8), v3 REHABILITERT — slår v2 på fersk gull (P 89.7/R 92.1 vs 86.8/86.8); adopsjonsbeslutning reversert [skip-docs] 2026-06-30 11:21:45 +02:00
judge-bakeoff-report-v2-reconciled.json feat(ms-ai-architect): Spor 2b gull-rekonsiliering — 12 uenigheter løst, fasit herdet (P 84→92%, R 84→88%) [skip-docs] 2026-06-30 07:20:21 +02:00
judge-bakeoff-report-v2-reconciled.md feat(ms-ai-architect): Spor 2b gull-rekonsiliering — 12 uenigheter løst, fasit herdet (P 84→92%, R 84→88%) [skip-docs] 2026-06-30 07:20:21 +02:00
judge-bakeoff-report-v2.json feat(ms-ai-architect): S1 v2 targeted iteration — GATE PASS (recall 84.2%, precision 84.2%) [skip-docs] 2026-06-26 21:23:50 +02:00
judge-bakeoff-report-v2.md feat(ms-ai-architect): S1 v2 targeted iteration — GATE PASS (recall 84.2%, precision 84.2%) [skip-docs] 2026-06-26 21:23:50 +02:00
judge-bakeoff-report-v3-g5bgold.json feat(ms-ai-architect): G5b gull-friskhets-spot-sjekk LUKKET — 4 v3-FP re-adjudert mot live, ALLE stale gull (v3 flagget korrekt), baseline løftet v3 P89.7/R92.1 → P100/R92.9/0FP; v3.1 forfattet (ren recall-hardning, FP-vakt droppet) [skip-docs] 2026-06-30 13:43:52 +02:00
judge-bakeoff-report-v3-g5bgold.md feat(ms-ai-architect): G5b gull-friskhets-spot-sjekk LUKKET — 4 v3-FP re-adjudert mot live, ALLE stale gull (v3 flagget korrekt), baseline løftet v3 P89.7/R92.1 → P100/R92.9/0FP; v3.1 forfattet (ren recall-hardning, FP-vakt droppet) [skip-docs] 2026-06-30 13:43:52 +02:00
judge-bakeoff-report-v3-g5gold.json feat(ms-ai-architect): G5 gull-friskhets-mikropass LUKKET — 2 gull-feil rettet (genaiops#2, model-selection#8), v3 REHABILITERT — slår v2 på fersk gull (P 89.7/R 92.1 vs 86.8/86.8); adopsjonsbeslutning reversert [skip-docs] 2026-06-30 11:21:45 +02:00
judge-bakeoff-report-v3-g5gold.md feat(ms-ai-architect): G5 gull-friskhets-mikropass LUKKET — 2 gull-feil rettet (genaiops#2, model-selection#8), v3 REHABILITERT — slår v2 på fersk gull (P 89.7/R 92.1 vs 86.8/86.8); adopsjonsbeslutning reversert [skip-docs] 2026-06-30 11:21:45 +02:00
judge-bakeoff-report-v3.1.json feat(ms-ai-architect): G1 LUKKET — v3.1 judge MÅLT + ADOPTERT (P100/R100/0FP/0FN, max-utfall) 2026-06-30 21:33:45 +02:00
judge-bakeoff-report-v3.1.md feat(ms-ai-architect): G1 LUKKET — v3.1 judge MÅLT + ADOPTERT (P100/R100/0FP/0FN, max-utfall) 2026-06-30 21:33:45 +02:00
judge-bakeoff-report-v3.json feat(ms-ai-architect): G1 v3 bake-off MÅLT — v3 regredierte (P 92.1→89.7, R flat), v2 beholdt; G5 gull-friskhet åpnet [skip-docs] 2026-06-30 10:54:39 +02:00
judge-bakeoff-report-v3.md feat(ms-ai-architect): G1 v3 bake-off MÅLT — v3 regredierte (P 92.1→89.7, R flat), v2 beholdt; G5 gull-friskhet åpnet [skip-docs] 2026-06-30 10:54:39 +02:00
judge-bakeoff-report.json feat(ms-ai-architect): S1 judge bake-off RESULT — GATE FAIL (recall 68.4% < 80%) [skip-docs] 2026-06-26 20:45:09 +02:00
judge-bakeoff-report.md feat(ms-ai-architect): S1 judge bake-off RESULT — GATE FAIL (recall 68.4% < 80%) [skip-docs] 2026-06-26 20:45:09 +02:00
judge-bakeoff-results-v2.json feat(ms-ai-architect): S1 v2 targeted iteration — GATE PASS (recall 84.2%, precision 84.2%) [skip-docs] 2026-06-26 21:23:50 +02:00
judge-bakeoff-results-v3.1.json feat(ms-ai-architect): G1 LUKKET — v3.1 judge MÅLT + ADOPTERT (P100/R100/0FP/0FN, max-utfall) 2026-06-30 21:33:45 +02:00
judge-bakeoff-results-v3.json feat(ms-ai-architect): G1 v3 bake-off MÅLT — v3 regredierte (P 92.1→89.7, R flat), v2 beholdt; G5 gull-friskhet åpnet [skip-docs] 2026-06-30 10:54:39 +02:00
judge-bakeoff-results.json feat(ms-ai-architect): S1 judge bake-off RESULT — GATE FAIL (recall 68.4% < 80%) [skip-docs] 2026-06-26 20:45:09 +02:00
judge-pass-manifest.json feat(ms-ai-architect): R7.5 KOMPLETT 51/51 — payload-31..51 dømt+ingestet, re-judge-gate bestått, async-processing stemplet [skip-docs] 2026-08-03 15:56:52 +02:00
judge-results.json feat(ms-ai-architect): Spor D steg A — eng+infra K10-fix → korpus-invariant ≥90 oppfylt 2026-06-23 17:56:43 +02:00
k1-trigger-prompts.json fix(ms-ai-architect): Sesjon 11 — K1 trigger-presisjon, blindet judge PASS alle 5 2026-06-20 10:00:47 +02:00
r11-footer-class-2026-08-11.json docs(ms-ai-architect): footer-klassen handklassifisert — 58 medlemmer, en fjerde unnslippsform, og «alle avvik samme vei» falt 2026-08-11 21:52:19 +02:00
r71-payloads.json feat(ms-ai-architect): R7.1 — judge-pass 30/45 filer (362/544 claims; 1 pass, 29 flagged, 106 flagg; v3.1-judge, ledger durabel per fil) [skip-docs] 2026-07-18 17:34:49 +02:00
spor0-fix-manifest.json fix(ms-ai-architect): R5 G5b — 4 innholds-fikser (retired gpt-35-turbo→gpt-4o-mini, vector-quant GA 2024-07-01, 2 overclaims nyansert), hver live-verifisert per MS Learn-kilde [skip-docs] 2026-07-04 17:09:23 +02:00