ms-ai-architect/scripts/kb-eval/data/judge-bakeoff-report-v3-g5gold.md

2.2 KiB

Judge bake-off-rapport — S1 (Fase 3 de-risk)

Generert deterministisk av run-judge-bakeoff.mjs over gold-correctness-set.json + judge-bakeoff-results.json. Tall fra testet lib/judge-bakeoff.mjs. Ikke rediger for hånd — regenerer.

Forhåndsregistrert gate (låst FØR fan-out): recall ≥ 0.7, presisjon ≥ 0.6, OG judge-recall > staleness-recall.

Evaluerings-populasjon (P)

Volatil stratum + fetchbare claim_types (price ekskludert) — der feilene bor; unngår «invertert leverage».

metrikk verdi
P totalt 255
Verifiserbare (correct/outdated/wrong) 240
Positive (reelle feil å fange) 38
Negative (correct) 202
Unsourced i P (kjørt, men utenfor P/R) 15

Arm-sammenligning (detektering over de 240 verifiserbare)

arm TP FP FN TN presisjon recall recall Wilson 95% F1
staleness (billig baseline) 0 0 38 202 n/a 0.0% [0.0%, 9.2%] n/a
judge (per-påstand groundedness) 35 4 3 198 89.7% 92.1% [79.2%, 97.3%] 0.909
hybrid (union) 35 4 3 198 89.7% 92.1% [79.2%, 97.3%] 0.909

Judge per claim_type (verifiserbar delmengde)

claim_type positive TP FP FN presisjon recall
taxonomy 11 9 0 2 100.0% 81.8%
version 7 7 0 0 100.0% 100.0%
status 7 6 3 1 66.7% 85.7%
sku 7 7 0 0 100.0% 100.0%
tpm 5 5 0 0 100.0% 100.0%
region 1 1 1 0 50.0% 100.0%

source_silent-diagnostikk

Judgen hentet siden men fant ikke verdien. Diagnostisk, ikke et flagg.

signal antall tolkning
På verifiserbar feil 0 judge-bom: reell feil oversett via «kan ikke verifisere»
På verifiserbar correct 0 judge reproduserte ikke et korrekt faktum mennesket fant
Enig med unsourced 2 judge reproduserer den uverifiserbare grensen (godt)
Uenig med unsourced 13 judge hevdet grunnet/ugrunnet der mennesket ikke fant kilde

GATE: PASS — bygg S3

  • recall 0.921 ≥ 0.7? ja
  • presisjon 0.897 ≥ 0.6? ja
  • slår staleness (recall 0.000)? ja
  • begrunnelse: all criteria met