45-veis v3.1 fan-out kjørt per runbook: 255 claims / 45 filer, 45 Opus-4.8-xhigh- subagenter (live MS Learn, blinde for gull, én per fil), aggregert 255/255 rent → deterministisk re-score mot G5b-korrigert gull. Resultat: v3.1 = P 100,0 / R 100,0 / 0 FP / 0 FN / F1 1,000 (TP 42, TN 198) mot v3-baren P 100,0 / R 92,9 / 3 FN. Alle 3 gjenstående FN fanget (R1 øvre-grense, R7 last-bærende-streng, R8 fler-delt) UTEN én ny FP. Forhåndsregistrert gate (hold P=100 ∧ løft R>92,9) klarert → v3.1 ADOPTERT som judge. R1-«+»-floor-flagg over full populasjon avkreftet som FP-risiko: alle matchet gull (decision-changing floors = outdated/TP; tette floors = correct/TN). §8 G1 lukket, G2 avblokkert (v3.1 = prompt å wire i transform.mjs). Suite 641/641. [skip-docs]
54 lines
2.2 KiB
Markdown
54 lines
2.2 KiB
Markdown
# Judge bake-off-rapport — S1 (Fase 3 de-risk)
|
|
|
|
_Generert deterministisk av `run-judge-bakeoff.mjs` over `gold-correctness-set.json` + `judge-bakeoff-results.json`. Tall fra testet `lib/judge-bakeoff.mjs`. Ikke rediger for hånd — regenerer._
|
|
|
|
**Forhåndsregistrert gate (låst FØR fan-out):** recall ≥ 0.7, presisjon ≥ 0.6, OG judge-recall > staleness-recall.
|
|
|
|
## Evaluerings-populasjon (P)
|
|
|
|
Volatil stratum + fetchbare claim_types (price ekskludert) — der feilene bor; unngår «invertert leverage».
|
|
|
|
| metrikk | verdi |
|
|
|---|---|
|
|
| P totalt | 255 |
|
|
| Verifiserbare (correct/outdated/wrong) | 240 |
|
|
| Positive (reelle feil å fange) | 42 |
|
|
| Negative (correct) | 198 |
|
|
| Unsourced i P (kjørt, men utenfor P/R) | 15 |
|
|
|
|
## Arm-sammenligning (detektering over de 240 verifiserbare)
|
|
|
|
| arm | TP | FP | FN | TN | presisjon | recall | recall Wilson 95% | F1 |
|
|
|---|---|---|---|---|---|---|---|---|
|
|
| staleness (billig baseline) | 0 | 0 | 42 | 198 | n/a | 0.0% | [0.0%, 8.4%] | n/a |
|
|
| judge (per-påstand groundedness) | 42 | 0 | 0 | 198 | 100.0% | 100.0% | [91.6%, 100.0%] | 1.000 |
|
|
| hybrid (union) | 42 | 0 | 0 | 198 | 100.0% | 100.0% | [91.6%, 100.0%] | 1.000 |
|
|
|
|
## Judge per claim_type (verifiserbar delmengde)
|
|
|
|
| claim_type | positive | TP | FP | FN | presisjon | recall |
|
|
|---|---|---|---|---|---|---|
|
|
| taxonomy | 11 | 11 | 0 | 0 | 100.0% | 100.0% |
|
|
| status | 10 | 10 | 0 | 0 | 100.0% | 100.0% |
|
|
| version | 7 | 7 | 0 | 0 | 100.0% | 100.0% |
|
|
| sku | 7 | 7 | 0 | 0 | 100.0% | 100.0% |
|
|
| tpm | 5 | 5 | 0 | 0 | 100.0% | 100.0% |
|
|
| region | 2 | 2 | 0 | 0 | 100.0% | 100.0% |
|
|
|
|
## source_silent-diagnostikk
|
|
|
|
Judgen hentet siden men fant ikke verdien. Diagnostisk, ikke et flagg.
|
|
|
|
| signal | antall | tolkning |
|
|
|---|---|---|
|
|
| På verifiserbar feil | 0 | judge-bom: reell feil oversett via «kan ikke verifisere» |
|
|
| På verifiserbar correct | 0 | judge reproduserte ikke et korrekt faktum mennesket fant |
|
|
| Enig med unsourced | 2 | judge reproduserer den uverifiserbare grensen (godt) |
|
|
| Uenig med unsourced | 13 | judge hevdet grunnet/ugrunnet der mennesket ikke fant kilde |
|
|
|
|
## GATE: ✅ PASS — bygg S3
|
|
|
|
- recall 1.000 ≥ 0.7? **ja**
|
|
- presisjon 1.000 ≥ 0.6? **ja**
|
|
- slår staleness (recall 0.000)? **ja**
|
|
- begrunnelse: all criteria met
|