Blind fan-out: 15 batcher Opus 4.8 xhigh, 255 P-påstander dekket (0 missing/dupes/extra), hver judget mot live MS Learn via microsoft_docs_fetch (judgen så aldri gull-verdict). Resultat mot forhåndsregistrert gate (recall >=0.80, presisjon >=0.70): - judge: presisjon 81.3% (PASS), recall 68.4% (FAIL, Wilson [52.5-80.9%]), F1 0.743, 26/38 fanget - staleness baseline: recall 0/38 (judge slår den desisivt) - recall-drag konsentrert: sku 37.5%, taxonomy 66.7%; version/status/tpm allerede 80-86% - 10/12 bommer var grounded-men-feil (brittle dekomponering, isolert til sku/taxonomy) Per pre-registrert gate: STOPP, bygg IKKE S3. Fork (operatør) registrert i plan-doc: (a) honorer FAIL, (b) scoped judge, (c) målrettet iterasjon + re-kjør.
2.2 KiB
2.2 KiB
Judge bake-off-rapport — S1 (Fase 3 de-risk)
Generert deterministisk av run-judge-bakeoff.mjs over gold-correctness-set.json + judge-bakeoff-results.json. Tall fra testet lib/judge-bakeoff.mjs. Ikke rediger for hånd — regenerer.
Forhåndsregistrert gate (låst FØR fan-out): recall ≥ 0.8, presisjon ≥ 0.7, OG judge-recall > staleness-recall.
Evaluerings-populasjon (P)
Volatil stratum + fetchbare claim_types (price ekskludert) — der feilene bor; unngår «invertert leverage».
| metrikk | verdi |
|---|---|
| P totalt | 255 |
| Verifiserbare (correct/outdated/wrong) | 240 |
| Positive (reelle feil å fange) | 38 |
| Negative (correct) | 202 |
| Unsourced i P (kjørt, men utenfor P/R) | 15 |
Arm-sammenligning (detektering over de 240 verifiserbare)
| arm | TP | FP | FN | TN | presisjon | recall | recall Wilson 95% | F1 |
|---|---|---|---|---|---|---|---|---|
| staleness (billig baseline) | 0 | 0 | 38 | 202 | n/a | 0.0% | [0.0%, 9.2%] | n/a |
| judge (per-påstand groundedness) | 26 | 6 | 12 | 196 | 81.3% | 68.4% | [52.5%, 80.9%] | 0.743 |
| hybrid (union) | 26 | 6 | 12 | 196 | 81.3% | 68.4% | [52.5%, 80.9%] | 0.743 |
Judge per claim_type (verifiserbar delmengde)
| claim_type | positive | TP | FP | FN | presisjon | recall |
|---|---|---|---|---|---|---|
| taxonomy | 9 | 6 | 4 | 3 | 60.0% | 66.7% |
| sku | 8 | 3 | 0 | 5 | 100.0% | 37.5% |
| version | 7 | 6 | 0 | 1 | 100.0% | 85.7% |
| status | 7 | 6 | 2 | 1 | 75.0% | 85.7% |
| tpm | 5 | 4 | 0 | 1 | 100.0% | 80.0% |
| region | 2 | 1 | 0 | 1 | 100.0% | 50.0% |
source_silent-diagnostikk
Judgen hentet siden men fant ikke verdien. Diagnostisk, ikke et flagg.
| signal | antall | tolkning |
|---|---|---|
| På verifiserbar feil | 2 | judge-bom: reell feil oversett via «kan ikke verifisere» |
| På verifiserbar correct | 0 | judge reproduserte ikke et korrekt faktum mennesket fant |
| Enig med unsourced | 5 | judge reproduserer den uverifiserbare grensen (godt) |
| Uenig med unsourced | 10 | judge hevdet grunnet/ugrunnet der mennesket ikke fant kilde |
GATE: ❌ FAIL — stopp, ikke bygg S3
- recall 0.684 ≥ 0.8? nei
- presisjon 0.813 ≥ 0.7? ja
- slår staleness (recall 0.000)? ja
- begrunnelse: recall 0.684 < minRecall 0.8