ms-ai-architect/scripts/kb-eval/data/judge-bakeoff-report-v3.md

2.2 KiB

Judge bake-off-rapport — S1 (Fase 3 de-risk)

Generert deterministisk av run-judge-bakeoff.mjs over gold-correctness-set.json + judge-bakeoff-results.json. Tall fra testet lib/judge-bakeoff.mjs. Ikke rediger for hånd — regenerer.

Forhåndsregistrert gate (låst FØR fan-out): recall ≥ 0.7, presisjon ≥ 0.6, OG judge-recall > staleness-recall.

Evaluerings-populasjon (P)

Volatil stratum + fetchbare claim_types (price ekskludert) — der feilene bor; unngår «invertert leverage».

metrikk verdi
P totalt 255
Verifiserbare (correct/outdated/wrong) 240
Positive (reelle feil å fange) 40
Negative (correct) 200
Unsourced i P (kjørt, men utenfor P/R) 15

Arm-sammenligning (detektering over de 240 verifiserbare)

arm TP FP FN TN presisjon recall recall Wilson 95% F1
staleness (billig baseline) 0 0 40 200 n/a 0.0% [0.0%, 8.8%] n/a
judge (per-påstand groundedness) 35 4 5 196 89.7% 87.5% [73.9%, 94.5%] 0.886
hybrid (union) 35 4 5 196 89.7% 87.5% [73.9%, 94.5%] 0.886

Judge per claim_type (verifiserbar delmengde)

claim_type positive TP FP FN presisjon recall
taxonomy 11 9 0 2 100.0% 81.8%
status 8 6 3 2 66.7% 75.0%
sku 8 7 0 1 100.0% 87.5%
version 7 7 0 0 100.0% 100.0%
tpm 5 5 0 0 100.0% 100.0%
region 1 1 1 0 50.0% 100.0%

source_silent-diagnostikk

Judgen hentet siden men fant ikke verdien. Diagnostisk, ikke et flagg.

signal antall tolkning
På verifiserbar feil 0 judge-bom: reell feil oversett via «kan ikke verifisere»
På verifiserbar correct 0 judge reproduserte ikke et korrekt faktum mennesket fant
Enig med unsourced 2 judge reproduserer den uverifiserbare grensen (godt)
Uenig med unsourced 13 judge hevdet grunnet/ugrunnet der mennesket ikke fant kilde

GATE: PASS — bygg S3

  • recall 0.875 ≥ 0.7? ja
  • presisjon 0.897 ≥ 0.6? ja
  • slår staleness (recall 0.000)? ja
  • begrunnelse: all criteria met