fix(b-gate): a probe is bound to its step, a reason cannot be empty, and the row's limit is what was measured [skip-docs]
Row 1 goes 3 of 17 -> 0 of 17. Nothing was removed from the product and no row
changed colour; the three that counted stopped counting because the contract they
satisfied was satisfiable without capability.
BEARING 1 -- the probe is bound to the step, and the binding is MEASURED in the
probe's own source. Chosen: read the probe (ast) rather than demand it live in a
contract-named file, because a file name is a convention a stub meets as easily as a
real probe. Three traits, each measured: it drives the DOOR (the dotted module or the
registered command name appears as a string it uses -- anywhere but a docstring,
because the honest form assembles argv in a variable first), it names the STEP (the
symbol, id or subcommand as a whole WORD in what it passes INTO a call or calls), and
it asserts at all. A probe claimed by two steps proves at most one and the gate cannot
tell which -- so neither.
Two traps found while measuring, both closed:
- substring: "gate" is not named by portfolio_optimiser.evals.v1_gate
- local alias: the first cut accepted step `gate` because the probe file imports the
module AS `gate`. Names are therefore read only where they are sent or called.
What that costs, measured against the contract that stands:
rundebinding drives the door, names no step (was green)
rapport never goes through the door at all (was green)
gate drives the door, names no step (was green)
BEARING 2 -- the limit statement said exactly TWO ways remained; the checkpoint
planted 21 call forms and measured SIX. Four are closed with a guard each (the
official Python SDK in both spellings, the node and uv runners, a dynamic import);
three remain and are now named: a runtime-composed name, a name from an environment
variable, a base64-decoded name. Left open deliberately -- the encodings are not
enumerable and our own contract stores base64 by design. Row 3: 9 of 9 -> 12 of 12,
still GREEN, 0 hits over 512 files. One of the three caught a command written in this
round's own test docstring; it was rewritten, not exempted.
BEARING 3 -- held_out accepted an EMPTY reason and shrank the denominator, while the
summary said "held out with a reason" either way. A blank reason is no reason: the
symbol stays in the denominator as a call without a door, the summary counts reasons,
and the four steps declared OUTSIDE the run path are now named one by one as having no
derived source instead of being counted in silence.
Five small rests, closed: a pruned manifest (451 of 512 was still GREEN) is now NOT
MEASURED, one sentinel per area the old handlist missed; a non-UTF-8 file is read as
byte text instead of counted and skipped; a symlink out of the tree is named and
fails the row; a runbook whose whole content is "x" no longer passes, the contract
names its sections; and the row states that its ratio is not a coverage measure.
Two stated, not closed, each with its reason in the row's own attestation: a po call
moved one floor down into a helper leaves the denominator (following helpers would
pull private ones in and make the denominator the curated list this row exists to
avoid), and row 3's k/n can still be padded by a guard with no measured escape behind
it. The ledger's two precision errors are corrected: "no row became greener" is true
of colour, not of numbers, and ENTRY_KINDS has three arts, not four.
Suite: 2172 passed, 5 skipped, 5 xfailed in 645 s. ruff and mypy clean.
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
parent
40869e272f
commit
9eec31b7da
4 changed files with 441 additions and 73 deletions
|
|
@ -3268,9 +3268,13 @@
|
|||
ordre `20260919T082156Z-338455001`):** operatørbeslutningen er at Claude Code LEDER i utvikling
|
||||
og test, at po er verktøykassen, og at produksjon kjører Foundry uten Claude i det hele tatt.
|
||||
`python -m portfolio_optimiser.evals.b_gate` er kontrakten den kapabiliteten skal leveres inn i,
|
||||
skrevet RØD før noe bygges: **3 av 17 · 0 av 2 · 9 av 9 · 0 av 3 · 4 av 5 · IKKE MÅLT**, exit 1.
|
||||
(Første utgave sa `3 av 13 · … · 6 av 6 · … · 1 av 2`; sjekkpunktet viste at tre av de nevnerne
|
||||
var gatens egne tall, ikke kildens. Ingen rad ble GRØNNERE av reparasjonen — nevnerne ble sanne.)
|
||||
skrevet RØD før noe bygges: **0 av 17 · 0 av 2 · 12 av 12 · 0 av 3 · 4 av 5 · IKKE MÅLT**, exit 1.
|
||||
(Utgave 1 sa `3 av 13 · … · 6 av 6 · … · 1 av 2`, utgave 2 `3 av 17 · … · 9 av 9 · … · 4 av 5`;
|
||||
begge sjekkpunktene viste at nevnere var gatens egne tall. **Ingen rad har skiftet FARGE i noen av
|
||||
de to reparasjonene — men tall har flyttet seg i begge retninger, og det skal sies presist:** rad
|
||||
5 gikk `1 av 2` → `4 av 5` fordi ENHETEN ble delt opp (0,50 → 0,80 — grønnere i tall, samme
|
||||
farge), rad 3 `6 av 6` → `9 av 9` → `12 av 12` fordi flaten og vaktene vokste, og rad 1 `3 av 17`
|
||||
→ `0 av 17` fordi proben ble bundet til steget. Ingen rad har blitt grønnere av en svakere prøve.)
|
||||
**Rad 1s nevner UTLEDES av kjørestien** (`run_path_calls`): 41 po-funksjoner kalles i
|
||||
`run.py::run_project` (PMs 39 deterministiske + `generate_via_llm`/`fresh_workflow`, som holdes
|
||||
utenfor fordi de krever chatklient). Et kall som verken er erklært som steg eller navngitt som
|
||||
|
|
@ -3283,20 +3287,21 @@
|
|||
`entry["kind"]` leses (den ble lest 0 ganger før) og må være én av tre arter gaten har kode for å
|
||||
etterprøve — `console-script` i pyproject, `module-main` med sin egen `__main__`-vakt,
|
||||
`subcommand` registrert i modulens egen argparse — og hvert steg må dessuten ha en navngitt probe
|
||||
som kaller døren og leser artefaktet. Målt: en modul med bare `def main(): return <symbol>()` tok
|
||||
rad 1 fra 3 til 4 av 13 før; nå avvises den under alle fire arter, med grunn.
|
||||
som er BUNDET til steget (avsnittet under). Målt: en modul med bare `def main(): return
|
||||
<symbol>()` tok rad 1 fra 3 til 4 av 13 før; nå avvises den under alle tre artene (`ENTRY_KINDS`
|
||||
har TRE arter, ikke fire), med grunn.
|
||||
**«Kallbar utenfra» betyr uten chatklient:** en inngang som når steget via en vei der
|
||||
`create_chat_client`/`client_factory`/`_default_factory` nevnes, teller IKKE (`entry_reaches`) —
|
||||
det er hele grunnen til at `run.py`-stegene er røde mens rundebinderen og v1-gaten er grønne.
|
||||
Sjekken er med vilje strengere enn nødvendig: den leser hele det `main` når i sin egen modul,
|
||||
ikke bare den ene veien ned. **Rad 3 er den eneste raden som er grønn, og den er grønn som en
|
||||
MÅLING:** ni vakter, hver med sin kjent-positive OG kjent-negative prøve, over **512 publiserte
|
||||
MÅLING:** tolv vakter, hver med sin kjent-positive OG kjent-negative prøve, over **512 publiserte
|
||||
filer lest av REPO-MANIFESTET** (`git ls-files`, eller filtreet selv i et rent uttrekk — som ER
|
||||
det publiserte). Håndlista på elleve `roots` den erstattet så 433 av dem: `main.py`,
|
||||
`examples/`, `spikes/`, `contexts/`, `CLAUDE.md` og `llms.txt` lå utenfor, og alle seks
|
||||
kjent-positive kunne plantes i `main.py` uten at raden merket det. Manifestet gjør tallet
|
||||
reproduserbart: 433 i uttrekk og 435 i arbeidstreet var de to gitignorerte `.local.md`-filene
|
||||
under `docs/plan/`. **Tre av de ni vaktene feller INDIREKTE kall** — absolutt sti, liste lagt i en
|
||||
under `docs/plan/`. **Tre av de tolv vaktene feller INDIREKTE kall** — absolutt sti, liste lagt i en
|
||||
variabel, konstant, shell-streng — så 5 av 5 av sjekkpunktets varianter avvises, med 0 falske
|
||||
positive målt over hele flaten. **En tom flate er `IKKE MÅLT`, aldri grønn:** raden krever en
|
||||
sentinel-fil og skriver både filtallet, hvilket manifest den leste og hvor mange filer som ikke
|
||||
|
|
|
|||
Loading…
Add table
Add a link
Reference in a new issue