Måleresultatets sentrale påstand — at forslagene er tekstlig ærlige — hvilte på et sesjons-lokalt skript ingen kunne etterprøve. Flyttet inn som bibliotek + CLI med tester, så tallet kan reproduseres fra fersk klon: node scripts/kb-eval/check-o2-returns.mjs Sjekkene avgjør IKKE O2 — betingelse 2 og 3 er fortsatt menneskelige. De avgrenser de to feilmodusene et menneske ikke fanger billig over 46 forslag: - V1: sitert filtekst må finnes ordrett i fila (fanger oppdiktet tekst og stille æøå-transliterering). Gjelder HVER rad, også O3 — en O3 basert på oppdiktet tekst er like feil, bare feil i trygg retning. - V2: forslaget må kunne oppnås ved kun å slette tegn. - V2b: V2 alene er for svak — 'Automatically add' -> 'Add' passerer fordi den store A-en fantes inne i det slettede ordet. Ordnivå-sjekk, case-sensitiv. - V3: skjema- og verdikt-koherens. Suite 996 -> 1021. |
||
|---|---|---|
| .. | ||
| kb-eval | ||
| kb-update | ||
| skill-gen | ||
| build-demo-state.mjs | ||
| export-pdf.py | ||
| kb-staleness-check.sh | ||