fix(ms-ai-architect): Sesjon 10 — K9-destale eng+infra (volatil status → ref)

Begge S10-kriterier møtt (operatør-gated kald LLM-judge): engineering K9 PASS,
infrastructure K9 PASS. Deterministisk ikke regredert: validate 239 · kb-eval 15
· kb-update 122 · kb-integrity 192/192. K4 hevet 4→5 begge skills.

Engineering: modellversjoner (GPT-4o/Whisper/Florence/text-embedding-3) →
generisk kapabilitets-framing; MAF-«erstatter SK»-transisjon + Foundry Agent
Service GA → pekere; «Start med GPT-4o» (ABSENT i ref) droppet.

Infrastructure: SLA-tabell (ABSENT i ref) → relativ-veiledning + MCP-peker;
RTO/RPO-tabell → sammendrag + peker (ref bærer hele tier-modellen); «peak+30%»
(ref sier 20%) → generisk; Phi-3/Phi-4 + parametertall → «Phi-familien»
(fjernet faktafeil «Phi-4 14B»).

Metode: read-only verifiserings-agenter kartla ref-dekning FØR sletting.
judge-results.json oppdatert med ferske kalde eng+infra-verdikter (_updated: S10).

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01REiKFhP4w6xGXXqWKpPCJJ
This commit is contained in:
Kjell Tore Guttormsen 2026-06-20 09:31:21 +02:00
commit 6b3c44adc3
4 changed files with 48 additions and 39 deletions

View file

@ -321,6 +321,24 @@ K1-presisjon (0,951,0) er **PROVISORISK** — operatør må kuratere 20 trigg
---
## Sesjon 10 (SPOR A — K9-destale: engineering + infrastructure) — RESULTATER (FERDIG, 2026-06-20)
**Begge S10-kriterier møtt** (operatør-gated kald LLM-judge): engineering **K9 PASS** (findings: []); infrastructure **K9 PASS** (findings: "None"). Deterministisk ikke regredert: **validate 239 · kb-eval 15 · kb-update 122 · kb-integrity 192/192**. gitleaks: 3 pre-eksisterende i `playground/vendor/` (utenfor changeset). K5 uendret (eng 0,23 · infra 0,97); refTall konsistent; K4 hevet eng 4→5 / infra 4→5 (mindre body-dup). Body krympet: infra K3 290→279 (eng uendret — generaliseringene byttet ord, ikke linjer).
**Metode (verifiseringspliktig):** to parallelle read-only verifiserings-agenter kartla FØR sletting hvor hvert volatilt body-faktum bor i ref (PRESENT/PARTIAL/ABSENT) → flytt (i ref) / dropp (uverifisert) / generaliser.
**Engineering (operatør-gated, 6 endringer):** §2 MAF-«erstatter Semantic Kernel»-transisjon → peker (ref bærer GA-dato/versjon); §intro/§3/§6 modellversjoner GPT-4o/Whisper/Florence/text-embedding-3 → generisk kapabilitets-framing (alle PRESENT i `azure-ai-services/*`+`multi-modal/*`); «Start med GPT-4o for prototyping» (ABSENT i ref) → dropp modellnavn, behold prinsipp; §8 Dekning «Foundry Agent Service GA»+«A2A/CUA/Foundry Workflows» → generiske topic-navn u/«GA» (filtall 24 urørt); «130+ språk» → «bred språkstøtte».
**Infrastructure (operatør-gated, 8 endringer):** §1.8 SLA-tabell (99.9/99.999/99.95 % — **ABSENT i ref**) → relativ-veiledning + MCP/`research-agent`-peker (ingen tall i body); §1.2 RTO/RPO-tabell → sammendrag + peker (ref `rto-rpo-planning-ai-services.md` bærer hele tier-modellen i 265 linjer; minuttverdier fjernet); §1.7 «peak + 30 % buffer» (ref sier 1.2×/20 %, avvikende) → «kapasitetsbuffer»; §2.2 «(tidl. Azure Stack HCI)» → dropp (ref bærer rename); §2.3/2.4/2.8/3.4 «Phi-3/Phi-4»+«(3.8B)/(14B)» → «Phi-familien» u/versjon+parametertall (fjerner også **faktafeil**: body sa «Phi-4 (14B)», ref tilskriver 14B til Phi-3 Medium); §1.1 «(bredere modellutvalg)» → dropp (ref bærer).
**To judge-runder for infra (dommeren er bindingen — ikke overstyrt):** runde 1 fanget at min FØRSTE SLA-omskriving introduserte et nytt konkret «99,9 %»-tall + flagget RTO-tabellens «< 5 min» (borderline). Fix: fjern alle SLA-prosenter fra prosa + flytt RTO/RPO-tabellen til peker → runde 2 **K9 PASS clean**.
**Judge-cache:** `judge-results.json` oppdatert med ferske kalde eng+infra-verdikter (operatør-gated; `_updated: S10`).
**Binding for S11:** K1 (#4) — 2 description-fikser (governance +Schrems II-trigger, advisor strammere) + draft 20 kandidat-prompts/skill → operatør-review. Merk: S10-judgen ga provisorisk K1 1.0 for begge eng+infra (rene description-grenser), men K1 forblir **PROVISORISK** til operatør kuraterer.
---
## SPOR A — gjenstående sesjoner (PLANLAGT, operatør godkjente alle 4 anbefalinger 2026-06-20)
De 4 beslutning-gated punktene er nå **avgjort** (operatør: «følger anbefalingene gjennomgående»):
@ -337,7 +355,7 @@ De 4 beslutning-gated punktene er nå **avgjort** (operatør: «følger anbefali
|---|---|---|
| **8** ✅ FERDIG (`1c0da88`, se «Sesjon 8 — RESULTATER») | **6×5-vekting (#1).** Fold adaptive workload-varianter inn i `security-scoring-rubrics-6x5.md` (Standard = kanonisk; foreslå eksakte varianttall, gated). Fjern divergerende vekttabell fra security SKILL.md → peker til rubrikken (behold risikoklassifiserings-tabellen — den er stabil). | `grep` security SKILL.md: ingen 3-kolonne-vekttabell med divergerende tall; rubrikken har én Standard + dokumenterte varianter; agent+skill peker samme kilde. `eval --json`: refTall/K5/K3 ikke regredert · validate 239 · kb-integrity grønt. **Antakelse testet:** ingen kode/test asserter SKILL.md-vekttallene (agenten bruker rubrikken — verifisert i S7-diskusjon; bekreft med `grep -r` på vekttallene før sletting). |
| **9** ✅ FERDIG (se «Sesjon 9 — RESULTATER») | **K4+K9 body-cleanup: security + governance** (begge feiler begge kriteriene). Tynn dupliserte avsnitt → pekere; flytt volatil status → ref. Gated forslag per skill FØR endring. | ✅ LLM-judge: security **K4 5/5 · K9 PASS** · governance **K4 5/5 · K9 PASS**. `eval`: K5 sec 16→20/gov 24→25, K3/refTall ikke regredert · kb-integrity 192/192 · validate 239. Antakelse testet (read-only verifiserings-agenter kartla ref-dekning FØR sletting). |
| **10** | **K9-destale: engineering + infrastructure** (feiler kun K9). Volatil status ut av body. Gated forslag FØR endring. | LLM-judge: **K9 PASS** eng+infra. `eval --json` ikke regredert · validate 239. |
| **10** ✅ FERDIG (se «Sesjon 10 — RESULTATER») | **K9-destale: engineering + infrastructure** (feiler kun K9). Volatil status ut av body. Gated forslag FØR endring. | LLM-judge: **K9 PASS** eng+infra (kald re-judge). `eval --json` ikke regredert (K5/refTall) · validate 239 · kb-integrity 192/192 · K4 hevet 4→5 begge. |
| **11** | **K1 (#4).** (a) 2 description-fikser: governance +Schrems II-trigger; advisor strammere (foreslå ordlyd, gated — K2-format må holdes). (b) draft 20 kandidat-prompts/skill → operatør-review → mål presisjon via judge. | LLM-judge **K1 ≥90 % treff / ≤10 % falske** for alle 5 (eller dokumentert avvik m/ begrunnelse) · K2 (description-format) fortsatt PASS etter edits. |
| **12** | **Lukk SPOR A.** Full LLM-judge re-run (K1/K4/K7/K8/K9) alle 5 → bekreft alle kriterier PASS → skriv ny `eval-baseline.json` (operatør-gated `--write`). (Kan foldes inn i S11 hvis lett.) | `eval-baseline.json`: ingen åpen eval-FAIL på tvers av K1K9 for de 5 skills. STATE: SPOR A FERDIG → Spor B neste. |