ms-ai-architect/scripts/kb-eval/data/judge-bakeoff-report-v2-g5bgold.md

2.2 KiB

Judge bake-off-rapport — S1 (Fase 3 de-risk)

Generert deterministisk av run-judge-bakeoff.mjs over gold-correctness-set.json + judge-bakeoff-results.json. Tall fra testet lib/judge-bakeoff.mjs. Ikke rediger for hånd — regenerer.

Forhåndsregistrert gate (låst FØR fan-out): recall ≥ 0.7, presisjon ≥ 0.6, OG judge-recall > staleness-recall.

Evaluerings-populasjon (P)

Volatil stratum + fetchbare claim_types (price ekskludert) — der feilene bor; unngår «invertert leverage».

metrikk verdi
P totalt 255
Verifiserbare (correct/outdated/wrong) 240
Positive (reelle feil å fange) 42
Negative (correct) 198
Unsourced i P (kjørt, men utenfor P/R) 15

Arm-sammenligning (detektering over de 240 verifiserbare)

arm TP FP FN TN presisjon recall recall Wilson 95% F1
staleness (billig baseline) 0 0 42 198 n/a 0.0% [0.0%, 8.4%] n/a
judge (per-påstand groundedness) 33 5 9 193 86.8% 78.6% [64.1%, 88.3%] 0.825
hybrid (union) 33 5 9 193 86.8% 78.6% [64.1%, 88.3%] 0.825

Judge per claim_type (verifiserbar delmengde)

claim_type positive TP FP FN presisjon recall
taxonomy 11 11 3 0 78.6% 100.0%
status 10 6 1 4 85.7% 60.0%
version 7 6 0 1 100.0% 85.7%
sku 7 5 1 2 83.3% 71.4%
tpm 5 4 0 1 100.0% 80.0%
region 2 1 0 1 100.0% 50.0%

source_silent-diagnostikk

Judgen hentet siden men fant ikke verdien. Diagnostisk, ikke et flagg.

signal antall tolkning
På verifiserbar feil 4 judge-bom: reell feil oversett via «kan ikke verifisere»
På verifiserbar correct 1 judge reproduserte ikke et korrekt faktum mennesket fant
Enig med unsourced 5 judge reproduserer den uverifiserbare grensen (godt)
Uenig med unsourced 10 judge hevdet grunnet/ugrunnet der mennesket ikke fant kilde

GATE: PASS — bygg S3

  • recall 0.786 ≥ 0.7? ja
  • presisjon 0.868 ≥ 0.6? ja
  • slår staleness (recall 0.000)? ja
  • begrunnelse: all criteria met