ms-ai-architect/scripts/kb-eval/data/judge-bakeoff-report-v2-g5gold.md

2.2 KiB

Judge bake-off-rapport — S1 (Fase 3 de-risk)

Generert deterministisk av run-judge-bakeoff.mjs over gold-correctness-set.json + judge-bakeoff-results.json. Tall fra testet lib/judge-bakeoff.mjs. Ikke rediger for hånd — regenerer.

Forhåndsregistrert gate (låst FØR fan-out): recall ≥ 0.7, presisjon ≥ 0.6, OG judge-recall > staleness-recall.

Evaluerings-populasjon (P)

Volatil stratum + fetchbare claim_types (price ekskludert) — der feilene bor; unngår «invertert leverage».

metrikk verdi
P totalt 255
Verifiserbare (correct/outdated/wrong) 240
Positive (reelle feil å fange) 38
Negative (correct) 202
Unsourced i P (kjørt, men utenfor P/R) 15

Arm-sammenligning (detektering over de 240 verifiserbare)

arm TP FP FN TN presisjon recall recall Wilson 95% F1
staleness (billig baseline) 0 0 38 202 n/a 0.0% [0.0%, 9.2%] n/a
judge (per-påstand groundedness) 33 5 5 197 86.8% 86.8% [72.7%, 94.2%] 0.868
hybrid (union) 33 5 5 197 86.8% 86.8% [72.7%, 94.2%] 0.868

Judge per claim_type (verifiserbar delmengde)

claim_type positive TP FP FN presisjon recall
taxonomy 11 11 3 0 78.6% 100.0%
version 7 6 0 1 100.0% 85.7%
status 7 6 1 1 85.7% 85.7%
sku 7 5 1 2 83.3% 71.4%
tpm 5 4 0 1 100.0% 80.0%
region 1 1 0 0 100.0% 100.0%

source_silent-diagnostikk

Judgen hentet siden men fant ikke verdien. Diagnostisk, ikke et flagg.

signal antall tolkning
På verifiserbar feil 2 judge-bom: reell feil oversett via «kan ikke verifisere»
På verifiserbar correct 3 judge reproduserte ikke et korrekt faktum mennesket fant
Enig med unsourced 5 judge reproduserer den uverifiserbare grensen (godt)
Uenig med unsourced 10 judge hevdet grunnet/ugrunnet der mennesket ikke fant kilde

GATE: PASS — bygg S3

  • recall 0.868 ≥ 0.7? ja
  • presisjon 0.868 ≥ 0.6? ja
  • slår staleness (recall 0.000)? ja
  • begrunnelse: all criteria met