ms-ai-architect/scripts/kb-eval/data/judge-bakeoff-report.md
Kjell Tore Guttormsen 79e34312ea feat(ms-ai-architect): S1 judge bake-off RESULT — GATE FAIL (recall 68.4% < 80%) [skip-docs]
Blind fan-out: 15 batcher Opus 4.8 xhigh, 255 P-påstander dekket (0 missing/dupes/extra),
hver judget mot live MS Learn via microsoft_docs_fetch (judgen så aldri gull-verdict).

Resultat mot forhåndsregistrert gate (recall >=0.80, presisjon >=0.70):
- judge: presisjon 81.3% (PASS), recall 68.4% (FAIL, Wilson [52.5-80.9%]), F1 0.743, 26/38 fanget
- staleness baseline: recall 0/38 (judge slår den desisivt)
- recall-drag konsentrert: sku 37.5%, taxonomy 66.7%; version/status/tpm allerede 80-86%
- 10/12 bommer var grounded-men-feil (brittle dekomponering, isolert til sku/taxonomy)

Per pre-registrert gate: STOPP, bygg IKKE S3. Fork (operatør) registrert i plan-doc:
(a) honorer FAIL, (b) scoped judge, (c) målrettet iterasjon + re-kjør.
2026-06-26 20:45:09 +02:00

2.2 KiB

Judge bake-off-rapport — S1 (Fase 3 de-risk)

Generert deterministisk av run-judge-bakeoff.mjs over gold-correctness-set.json + judge-bakeoff-results.json. Tall fra testet lib/judge-bakeoff.mjs. Ikke rediger for hånd — regenerer.

Forhåndsregistrert gate (låst FØR fan-out): recall ≥ 0.8, presisjon ≥ 0.7, OG judge-recall > staleness-recall.

Evaluerings-populasjon (P)

Volatil stratum + fetchbare claim_types (price ekskludert) — der feilene bor; unngår «invertert leverage».

metrikk verdi
P totalt 255
Verifiserbare (correct/outdated/wrong) 240
Positive (reelle feil å fange) 38
Negative (correct) 202
Unsourced i P (kjørt, men utenfor P/R) 15

Arm-sammenligning (detektering over de 240 verifiserbare)

arm TP FP FN TN presisjon recall recall Wilson 95% F1
staleness (billig baseline) 0 0 38 202 n/a 0.0% [0.0%, 9.2%] n/a
judge (per-påstand groundedness) 26 6 12 196 81.3% 68.4% [52.5%, 80.9%] 0.743
hybrid (union) 26 6 12 196 81.3% 68.4% [52.5%, 80.9%] 0.743

Judge per claim_type (verifiserbar delmengde)

claim_type positive TP FP FN presisjon recall
taxonomy 9 6 4 3 60.0% 66.7%
sku 8 3 0 5 100.0% 37.5%
version 7 6 0 1 100.0% 85.7%
status 7 6 2 1 75.0% 85.7%
tpm 5 4 0 1 100.0% 80.0%
region 2 1 0 1 100.0% 50.0%

source_silent-diagnostikk

Judgen hentet siden men fant ikke verdien. Diagnostisk, ikke et flagg.

signal antall tolkning
På verifiserbar feil 2 judge-bom: reell feil oversett via «kan ikke verifisere»
På verifiserbar correct 0 judge reproduserte ikke et korrekt faktum mennesket fant
Enig med unsourced 5 judge reproduserer den uverifiserbare grensen (godt)
Uenig med unsourced 10 judge hevdet grunnet/ugrunnet der mennesket ikke fant kilde

GATE: FAIL — stopp, ikke bygg S3

  • recall 0.684 ≥ 0.8? nei
  • presisjon 0.813 ≥ 0.7? ja
  • slår staleness (recall 0.000)? ja
  • begrunnelse: recall 0.684 < minRecall 0.8