ms-ai-architect/scripts/kb-eval/data/judge-bakeoff-report-v3-g5bgold.md

2.2 KiB

Judge bake-off-rapport — S1 (Fase 3 de-risk)

Generert deterministisk av run-judge-bakeoff.mjs over gold-correctness-set.json + judge-bakeoff-results.json. Tall fra testet lib/judge-bakeoff.mjs. Ikke rediger for hånd — regenerer.

Forhåndsregistrert gate (låst FØR fan-out): recall ≥ 0.7, presisjon ≥ 0.6, OG judge-recall > staleness-recall.

Evaluerings-populasjon (P)

Volatil stratum + fetchbare claim_types (price ekskludert) — der feilene bor; unngår «invertert leverage».

metrikk verdi
P totalt 255
Verifiserbare (correct/outdated/wrong) 240
Positive (reelle feil å fange) 42
Negative (correct) 198
Unsourced i P (kjørt, men utenfor P/R) 15

Arm-sammenligning (detektering over de 240 verifiserbare)

arm TP FP FN TN presisjon recall recall Wilson 95% F1
staleness (billig baseline) 0 0 42 198 n/a 0.0% [0.0%, 8.4%] n/a
judge (per-påstand groundedness) 39 0 3 198 100.0% 92.9% [81.0%, 97.5%] 0.963
hybrid (union) 39 0 3 198 100.0% 92.9% [81.0%, 97.5%] 0.963

Judge per claim_type (verifiserbar delmengde)

claim_type positive TP FP FN presisjon recall
taxonomy 11 9 0 2 100.0% 81.8%
status 10 9 0 1 100.0% 90.0%
version 7 7 0 0 100.0% 100.0%
sku 7 7 0 0 100.0% 100.0%
tpm 5 5 0 0 100.0% 100.0%
region 2 2 0 0 100.0% 100.0%

source_silent-diagnostikk

Judgen hentet siden men fant ikke verdien. Diagnostisk, ikke et flagg.

signal antall tolkning
På verifiserbar feil 0 judge-bom: reell feil oversett via «kan ikke verifisere»
På verifiserbar correct 0 judge reproduserte ikke et korrekt faktum mennesket fant
Enig med unsourced 2 judge reproduserer den uverifiserbare grensen (godt)
Uenig med unsourced 13 judge hevdet grunnet/ugrunnet der mennesket ikke fant kilde

GATE: PASS — bygg S3

  • recall 0.929 ≥ 0.7? ja
  • presisjon 1.000 ≥ 0.6? ja
  • slår staleness (recall 0.000)? ja
  • begrunnelse: all criteria met