docs(brief): correlate V2 incidents against claude-playlist-corpus sessions

Corrects a stale premise from the prior session's STATE (wrong plugin data
directory) and resolves the brief's row 1c and all three open questions:
rapid-fire event confirmed structurally via shared session_id, stuck/spiral
event remains unresolved (date mismatch with V2's account), and G1/G2 stay
out of scope pending other repos.

Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01NSJYvNduomkq3sfbELpqnK
This commit is contained in:
Kjell Tore Guttormsen 2026-08-13 21:34:39 +02:00
commit fa54d74c1d

View file

@ -20,7 +20,7 @@ denne sesjonen stopper ved brief + STATE-oppdatering, per kontrakten.
|---|---|---|---|
| 1a | Burst-heuristikken («Rapid-fire») kan ikke skille lesetempo fra redigeringstempo — leseintensivt arbeid vil trigge den | **BEKREFTET** | `hooks/scripts/tool-tracker.mjs:48-58,109-115` + `lib.mjs:127-129`: `burstCount` øker på ethvert verktøykall <30s fra forrige, uavhengig av verktøytype. En bulk-lesing (mange raske `Read`-kall) og en faktisk «rapid-fire»-editeringssekvens produserer identisk signal. Ingen `tool_name`-differensiering i denne banen. |
| 1b | Edit-ratio-heuristikken («possible stuck/spiral») kan ikke skille analysearbeid fra fastlåsthet | **BEKREFTET** | `tool-tracker.mjs:78-80,119-121`: `editRatio = edits/totalTools`, terskel <10 % over ≥30 min. En leseintensiv analyseoppgave (mange `Read`/`Grep`, få `Edit`) har strukturelt lav edit-ratio uavhengig av om arbeidet er produktivt. |
| 1c | De to konkrete hendelsene (v1: «possible stuck/spiral» under legitim analyse; denne sesjonen: «Rapid-fire: 5 consecutive» under en planlagt 39-fils bulk-lesning 2026-07-18) faktisk inntraff slik beskrevet | **IKKE VERIFISERBART HERFRA** | `~/.claude/plugins/data/ai-psychosis/sessions.jsonl` (dette repoets egen plugin-datakatalog) har ingen poster for 2026-07-18 — siste post er 2026-06-24. Hendelsene beskrevet i V2 skjedde etter alt å dømme i en **annen** økt/repo mens denne pluginen var globalt aktiv (den kjører uansett hvilket repo man står i), ikke i data denne økten har tilgang til. Jeg kan verken bekrefte eller avkrefte de to spesifikke hendelsene — bare at *mekanismen* som ville produsert dem er reell (1a, 1b). |
| 1c | De to konkrete hendelsene (v1: «possible stuck/spiral» under legitim analyse; denne sesjonen: «Rapid-fire: 5 consecutive» under en planlagt 39-fils bulk-lesning 2026-07-18) faktisk inntraff slik beskrevet | **DELVIS BEKREFTET (2026-08-13)** | Korrigert premiss: `~/.claude/plugins/data/ai-psychosis/` (uten marketplace-suffiks) var feil katalog å sjekke — pluginens faktiske datakatalog er `~/.claude/plugins/data/ai-psychosis-ktg-plugin-marketplace/`, delt på tvers av ALLE repo/installasjoner (ikke per-prosjekt). `claude-playlist-corpus`s egne økt-transkripter (`~/.claude/projects/-Users-ktg-repos-claude-playlist-corpus/*.jsonl`) korrelerer via `session_id` mot 3 økter 2026-07-18 og 3 økter 2026-07-17. **Rapid-fire-hendelsen (07-18): BEKREFTET.** Økt `fe336bc5` (06:4306:58, 153 verktøykall, 0 edits, 1 turn) har en sammenhengende rekke på **131 kall** under 30s mellomrom — langt over `THRESHOLD_SOFT_BURST=5`. Alarmen ville uunngåelig og gjentatt trigget. Mønsteret (høyt volum, ingen edits, én turn) matcher «planlagt 39-fils bulk-lesning» presist. **Stuck/spiral-hendelsen (v1, antatt 07-17): UAVKLART.** De to 07-17-øktene som korrelerer (19 min/629 kall/0 edits; 29 min/45 kall/5 edits) krysser aldri `THRESHOLD_LOW_EDIT_MIN_DURATION=30` min — varselet kan strukturelt ikke ha trigget fra disse to øktene alene. Derimot krysser den påfølgende 07-18-økten `92d1c961` (06:5808:08, 69 min, 12/126 edits = 9,5 % < `THRESHOLD_LOW_EDIT_RATIO=10`) begge terskler og ville trigget edit-ratio-varselet — men den er datert 07-18, ikke 07-17, og V2 beskriver den som en egen («v1») hendelse atskilt fra bulk-lesningen. Enten er datoattribueringen i V2 unøyaktig (samme arbeidsøkt, ikke to separate), eller v1-sesjonen ligger utenfor de 6 korrelerte øktene. Metodenotat: JSONL-formatet logger aldri *hvilket* varsel som faktisk ble vist (ingen persistert `alert_fired`-felt) — kun de rå signalene (tool_count/edit_count/varighet/tidsstempler) varselet regnes ut fra. «Bekreftet» over betyr: terskelbetingelsene var strukturelt oppfylt, ikke et logget bevis på at teksten faktisk rendret i den økten. |
| 2 | Duolingo-funnet (`CDqzWpwkSls`): human-in-the-loop gir ofte stempling, ikke etterforskning; tekstendring kuttet falske avvisninger 21 % | **IKKE EN KODE-PÅSTAND** | Dette er et designprinsipp fra ekstern forskning, ikke en påstand om denne pluginens nåværende tilstand. Jeg har ikke sett primærkilden (videoen) selv og tar tallene som rapportert av V2, uverifisert utover det. Relevansen for `/interaction-report`s ordlyd er en vurdering, ikke en kode-sjekk. |
| 3 | Addy Osmani-rammeverket (`4sX_He5c4sI`): cognitive debt / cognitive surrender / orchestration tax | **IKKE EN KODE-PÅSTAND** | Samme som over — eksternt begrepsapparat foreslått som språk for rapportene, ikke en påstand om dagens kode. Uverifisert utover det V2 rapporterer. |
| 4 | Layer-2-analytics: kun enkeltrapporter i dag, ingen trend-loop over akkumulert JSONL | **DELVIS AVKREFTET / ENDRET** | `commands/interaction-report.md:183-190,329-338`: `/interaction-report weekly` og `monthly` beregner ALLEREDE periode-over-periode-trend (samme metrikker for forrige periode, delta). V2s framing («bare enkeltrapporter») er unøyaktig. Det som derimot IKKE finnes: den spesifikke metoden V2 peker på (`B95cu7seTm8` — mine transkripter for atferdssekvens-metrikker som reads-før-edits og tests-etter-edits-ratioer). Dagens datamodell lagrer kun boolske flagg og aggregerte tellere (`events.jsonl`: `{ts, session_id, tool_name}`), ikke rekkefølge-par mellom spesifikke verktøykall — og kan strukturelt ikke uten en datamodellendring. |
@ -100,19 +100,22 @@ tiltak 1 og 2 er på plass og målt. Nevnes som mulig neste steg, ikke anbefalt
## Åpne spørsmål til operatøren
1. Skal tiltak 1 (kalibrering av burst/edit-ratio mot oppgavetype) tas som egen
TDD-oppgave nå, eller vente til flere reelle FP-hendelser er observert (den
nåværende plugin-datakatalogen har ingen data etter 2026-06-24 — vet vi om
pluginen faktisk kjører aktivt for øyeblikket)?
2. Er de to spesifikke hendelsene fra V2 (v1-sesjonen, og bulk-lesningen
2026-07-18) verifiserbare fra `claude-playlist-corpus`s egen side — altså i
DERES plugin-datakatalog, siden hendelsene sannsynligvis skjedde der pluginen
var aktiv mens claude-playlist-corpus-repoet ble jobbet i? Det ville gjort
punkt 1c om fra uverifiserbart til bekreftet/avkreftet.
3. Skal G1 (skill-evals) og G2 (CI) — som V2 selv sier gjelder på tvers av repoer
med andre repoer som første kandidater — tas opp igjen for ai-psychosis når de
initiativene eventuelt starter andre steder, eller behandles de som ute av
scope for dette repoet permanent?
1. **BESVART (2026-08-13).** Tiltak 1 ble tatt som egen TDD-oppgave og levert
(`2c9e2de`) — se STATE.md. Premisset i spørsmålet («ingen data etter
2026-06-24») var basert på feil katalogsti; pluginen kjørte da spørsmålet ble
stilt, og datakatalogen (riktig sti: se punkt 1c over) viser kontinuerlig
drift 2026-06-23→2026-07-20, deretter et 24-dagers opphold til aktiveringen
2026-08-13 kl. 21:06 (`settings.json:219` false→true).
2. **BESVART (2026-08-13) — se punkt 1c i tabellen over.** Korrelert mot
`claude-playlist-corpus`s egne økt-transkripter via delt `session_id`.
Rapid-fire-hendelsen (07-18) er bekreftet strukturelt; stuck/spiral-hendelsen
(v1, 07-17) er uavklart — de korrelerte 07-17-øktene krysser aldri
varighetsterskelen varselet krever.
3. **Operatørbeslutning (2026-08-13): ta opp igjen senere.** G1 (skill-evals) og
G2 (CI) forblir ute av scope for ai-psychosis inntil de initiativene ev.
starter i et annet repo (V2 peker på `config-audit`/`llm-security` for G1,
`catalog`/sikkerhetsgrense-repoer for G2) — revurderes da, ikke lukket
permanent.
---