docs(ms-ai-architect): Sesjon 8 SPOR A-resultater i roadmap + STATE
- Roadmap: «Sesjon 8 — RESULTATER» (6×5-vekting konsolidert til kanonisk rubrikk; varianttall, antakelse-test, ⚠ flagget risikotabell-divergens utenfor scope). Tabellrad 8 markert ✅ FERDIG. - STATE: S8 ferdig → NESTE = Sesjon 9 (K4+K9 body-cleanup sec+gov, inkl. K4-re-judge for security). kb-integrity 181→182. Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01REiKFhP4w6xGXXqWKpPCJJ
This commit is contained in:
parent
a6bda85c6e
commit
2356d211ee
1 changed files with 19 additions and 1 deletions
|
|
@ -282,6 +282,24 @@ K1-presisjon (0,95–1,0) er **PROVISORISK** — operatør må kuratere 20 trigg
|
|||
|
||||
---
|
||||
|
||||
## Sesjon 8 (SPOR A — 6×5-vekting) — RESULTATER (FERDIG, 2026-06-20)
|
||||
|
||||
**Akseptansekriterier møtt** (commit `1c0da88`): `grep` security SKILL.md → ingen 3-kolonne divergerende vekttabell; rubrikken har én Standard (kanonisk) + 2 dokumenterte varianter; agent+skill peker samme kilde. `eval --json` security: **K3 212→203 (pass) · K5 0,2581 uendret (16 navngitte, pass) · K6 16 (pass) · refConsistency 0 mismatch** — ingen deterministisk regresjon. Tester grønne: **validate 239 · kb-eval 15 · kb-integrity 182/182** (opp fra 181). gitleaks rent.
|
||||
|
||||
**Antakelse-test (FØR sletting):** `grep -r` på vekttallene bekreftet at INGEN kode/test asserter SKILL.md-vektene — `security-assessment-agent` (L24) refererer kun rubrikken som OBLIGATORISK. Eneste andre treff var eval-bevis (`judge-results.json` L38 / `eval-baseline.json` L476) som beskriver selve K4-bug-en. Trygt slettet.
|
||||
|
||||
**Endring 1 — rubrikk:** ny seksjon «Arbeidsbelastnings-profiler (adaptiv vekting)» under Vektingsmodell. Standard = kanonisk (Compliance 25/Data 20/Identity 20/Content 15/Network 10/Mon 10). Variantene utledet ved å bevare de godkjente retningsdeltaene fra SKILL.md-modellen, re-forankret til kanonisk baseline (sum 100 % begge):
|
||||
- **Eksternt eksponert:** Identity 25/Content 20/Network 15 ↑ (angrepsflate mot anonyme); Compliance 20/Data 15/Mon 5 ↓.
|
||||
- **Persondata-intensiv:** Compliance 30/Data 25 ↑; Content 10/Mon 5 ↓.
|
||||
|
||||
**Endring 2 — SKILL.md:** fjernet divergerende 3-kolonne vekttabell → peker til rubrikken. **Risikoklassifiserings-tabellen beholdt** (per roadmap).
|
||||
|
||||
**K4-status:** body-divergensen er løst, men K4-re-judgen er operatør-gated og hører i S9 — judge-cachen er IKKE rørt i S8 (ville fabrikkert en verdict). S9 plukker opp K4-rejudge for security.
|
||||
|
||||
**⚠ Funn utenfor scope (flagget, ikke handlet):** SKILL.md-risikotabellen (L63-69: `3.1–3.5 = Moderat`) **divergerer** fra rubrikkens risikokategori-mapping (`2.50–3.49 = Høy`; egen «Uakseptabel»-kategori under 1,50). Roadmap sa eksplisitt «behold risikoklassifiserings-tabellen», så urørt — men dette er en reell andre-divergens på linje med vekt-bug-en. **Kandidat for egen sesjon / S9-tillegg** (operatør avgjør).
|
||||
|
||||
---
|
||||
|
||||
## SPOR A — gjenstående sesjoner (PLANLAGT, operatør godkjente alle 4 anbefalinger 2026-06-20)
|
||||
|
||||
De 4 beslutning-gated punktene er nå **avgjort** (operatør: «følger anbefalingene gjennomgående»):
|
||||
|
|
@ -296,7 +314,7 @@ De 4 beslutning-gated punktene er nå **avgjort** (operatør: «følger anbefali
|
|||
|
||||
| Sesjon | Leveranse | Verifiserbart kriterium |
|
||||
|---|---|---|
|
||||
| **8** | **6×5-vekting (#1).** Fold adaptive workload-varianter inn i `security-scoring-rubrics-6x5.md` (Standard = kanonisk; foreslå eksakte varianttall, gated). Fjern divergerende vekttabell fra security SKILL.md → peker til rubrikken (behold risikoklassifiserings-tabellen — den er stabil). | `grep` security SKILL.md: ingen 3-kolonne-vekttabell med divergerende tall; rubrikken har én Standard + dokumenterte varianter; agent+skill peker samme kilde. `eval --json`: refTall/K5/K3 ikke regredert · validate 239 · kb-integrity grønt. **Antakelse testet:** ingen kode/test asserter SKILL.md-vekttallene (agenten bruker rubrikken — verifisert i S7-diskusjon; bekreft med `grep -r` på vekttallene før sletting). |
|
||||
| **8** ✅ FERDIG (`1c0da88`, se «Sesjon 8 — RESULTATER») | **6×5-vekting (#1).** Fold adaptive workload-varianter inn i `security-scoring-rubrics-6x5.md` (Standard = kanonisk; foreslå eksakte varianttall, gated). Fjern divergerende vekttabell fra security SKILL.md → peker til rubrikken (behold risikoklassifiserings-tabellen — den er stabil). | `grep` security SKILL.md: ingen 3-kolonne-vekttabell med divergerende tall; rubrikken har én Standard + dokumenterte varianter; agent+skill peker samme kilde. `eval --json`: refTall/K5/K3 ikke regredert · validate 239 · kb-integrity grønt. **Antakelse testet:** ingen kode/test asserter SKILL.md-vekttallene (agenten bruker rubrikken — verifisert i S7-diskusjon; bekreft med `grep -r` på vekttallene før sletting). |
|
||||
| **9** | **K4+K9 body-cleanup: security + governance** (begge feiler begge kriteriene). Tynn dupliserte avsnitt → pekere; flytt volatil status → ref. Gated forslag per skill FØR endring. | LLM-judge: **K4 ≥4/5 OG K9 PASS** for sec+gov. `eval --json`: K5/K3/refTall ikke regredert · kb-integrity (alle refs resolver) · validate 239. **Antakelse:** flyttet innhold finnes ALLEREDE i en ref-fil — verifiser FØR sletting fra body (ellers skriv ref-fil først, gated). |
|
||||
| **10** | **K9-destale: engineering + infrastructure** (feiler kun K9). Volatil status ut av body. Gated forslag FØR endring. | LLM-judge: **K9 PASS** eng+infra. `eval --json` ikke regredert · validate 239. |
|
||||
| **11** | **K1 (#4).** (a) 2 description-fikser: governance +Schrems II-trigger; advisor strammere (foreslå ordlyd, gated — K2-format må holdes). (b) draft 20 kandidat-prompts/skill → operatør-review → mål presisjon via judge. | LLM-judge **K1 ≥90 % treff / ≤10 % falske** for alle 5 (eller dokumentert avvik m/ begrunnelse) · K2 (description-format) fortsatt PASS etter edits. |
|
||||
|
|
|
|||
Loading…
Add table
Add a link
Reference in a new issue