ms-ai-architect/scripts/kb-eval/data
Kjell Tore Guttormsen 878292f467 feat(ms-ai-architect): idx-33 renvasket mot levende CAF, idx-36 var to instanser ikke en companion [skip-docs]
idx-33 RESOLVED SOM CHECKED-AND-CLEAR, ingen KB-edit. Entryen sa selv at et
premiss var umaalt: whether the CAF attribution is itself supported has not
been checked. Maalt 2026-08-13 mot levende Cloud Adoption Framework Secure AI
via microsoft-learn MCP: alle fire elementene i anker-linja staar paa sida
(Azure Resource Graph for asset inventory, managed identities + virtual
networks, APIM for MCP-endepunkter, Purview IRM for prompt-based data
exfiltration). Attribusjonen holder.

Stempel-dekningen maalt FOERST (#29), og den peker motsatt vei av idx-26i:
den fila hadde null stempler, saa klassen kunne ikke overfoeres. Her finnes
5 x (Verified MCP 2026-04) og ett av dem sitter PAA anker-linja, saa klassen
gjelder og testen blir om stempelet er fortjent. Det er det.

Kryss-fil-paastanden adjudisert under #33 - sveip lokaliserer, kilden
adjudiserer. Entryens fire filer er maalt til TRE (incident-response,
data-leakage-prevention, norge-ai-strategy); alle attribuerer til CAF og
alle er dekket. r11-pilot-results 9.5 skrev at least four og enumererte
selv tre. #33 tjente dessuten sin plass paa en fjerde fil:
ai-security-scoring-framework.md:135 parer Azure Resource Graph med Defender
for Cloud - samme produktpar som VAR defekten her - og er KORREKT der, fordi
den fila siterer defender-for-cloud/resource-graph-samples. Samme streng,
annen kilde, motsatt dom. Bokfoert checked-and-clear.

idx-36 ANVENDT, to editer i samme fil, samme commit (#32-formen).
Subtraksjonen verifisert mot kilden fila selv kaller Authoritative guide:
#2a targeted poisoning = Critical, #2b indiscriminate = Important, #10
backdoor = Critical. Raden ga Critical til begge variantene.

ENTRYENS EGET ANKER PEKTE PAA FEIL LINJE. Koea ankret paa Oker severity bar
(spm. 4, physical domain) - som ikke siterer poisoning-raden og ikke er
defekt. Evidensen sier prose at 310; lest ordrett ut av 957ebef^ er
pre-edit 310 = Backdoored models og data poisoning er Critical-severity
trusler (spm. 3, post-edit 309). anchors-feltet staar urort som historisk
record; korreksjonen ligger i resolution.

OG FRAMINGEN SNUDDE: 9.5 holdt idx-36 tilbake fordi tabellen ville bli mer
presis enn prosaen som siterer den - companion-editen som KONSEKVENS av
editen. Maalt mot kilden over-paastaar l.309 allerede i dag. Tabell-editen
skaper ikke feilen, den avdekker den. To instanser av EN defekt, ikke en
out-of-envelope companion.

Enumerasjon lukket foer anvendelse: 8 poisoning-linjer, kun 38 og 309 baerer
severity-paastand. Cond 3 (slipp dekningen vs legg til rad) ratifisert som
slipp - fila blir taus om indiscriminate, ikke usann. Prosa-editen er en
INNSETTING, saa apply-o2-ratified.mjs kunne ikke skrive den: begge editer
haandlagt med hel-linje-unikhet sjekket foerst (1 treff hver) og diff lest i
kontekst etterpaa. Fila uendret paa 368 linjer.

NY ENTRY idx-33a reist, ikke roert: l.213 under Defender-blokka dropper
identity og legger til AI models mot levende AISPM-side, og filas 8 kilder
inneholder ingen Defender AISPM-kilde - stemplet blokka siterer utenfor
filas egen kildeliste. Koea: 59 entries (4 aapne, 55 resolved).

Suite 1052/1052. check-g7-queue exit 0.

[skip-docs]: ren KB-korrektur, ingen endring i kommandoer/agenter/skills/hooks.
2026-08-13 23:06:44 +02:00
..
fase0-returns feat(ms-ai-architect): Fase 0 steg 2 — verifiserings-fan-out (373 påstander) + gull-sett m/ deterministisk lastmod-join + TDD [skip-docs] 2026-06-26 15:16:10 +02:00
r11-o2-returns feat(ms-ai-architect): R11 §10 måling #2 bølge 2 — alle 46 R8-enumerasjoner klassifisert [skip-docs] 2026-08-03 17:36:29 +02:00
base-rate-report.json feat(ms-ai-architect): Fase 0 steg 3 — base-rate-rapport + GATE: BYGG Fase 3 (scoped/hybrid) [skip-docs] 2026-06-26 17:15:54 +02:00
base-rate-report.md feat(ms-ai-architect): Fase 0 steg 3 — base-rate-rapport + GATE: BYGG Fase 3 (scoped/hybrid) [skip-docs] 2026-06-26 17:15:54 +02:00
eval-baseline.json feat(ms-ai-architect): Sesjon 15 — B2 K10 søsken-scope-ikke-overlapp 2026-06-20 11:59:59 +02:00
fase0-sample-frame.json feat(ms-ai-architect): Fase 0 steg 1 — deterministisk sample-frame (45 volatil + 10 kontroll) + TDD [skip-docs] 2026-06-26 14:18:53 +02:00
g7-review-queue.json feat(ms-ai-architect): idx-33 renvasket mot levende CAF, idx-36 var to instanser ikke en companion [skip-docs] 2026-08-13 23:06:44 +02:00
gold-correctness-set.json feat(ms-ai-architect): G5b gull-friskhets-spot-sjekk LUKKET — 4 v3-FP re-adjudert mot live, ALLE stale gull (v3 flagget korrekt), baseline løftet v3 P89.7/R92.1 → P100/R92.9/0FP; v3.1 forfattet (ren recall-hardning, FP-vakt droppet) [skip-docs] 2026-06-30 13:43:52 +02:00
judge-bakeoff-claims.json feat(ms-ai-architect): S1 judge bake-off harness + forhåndsregistrert gate (TDD) [skip-docs] 2026-06-26 20:10:58 +02:00
judge-bakeoff-report-v2-g5bgold.json feat(ms-ai-architect): G5b gull-friskhets-spot-sjekk LUKKET — 4 v3-FP re-adjudert mot live, ALLE stale gull (v3 flagget korrekt), baseline løftet v3 P89.7/R92.1 → P100/R92.9/0FP; v3.1 forfattet (ren recall-hardning, FP-vakt droppet) [skip-docs] 2026-06-30 13:43:52 +02:00
judge-bakeoff-report-v2-g5bgold.md feat(ms-ai-architect): G5b gull-friskhets-spot-sjekk LUKKET — 4 v3-FP re-adjudert mot live, ALLE stale gull (v3 flagget korrekt), baseline løftet v3 P89.7/R92.1 → P100/R92.9/0FP; v3.1 forfattet (ren recall-hardning, FP-vakt droppet) [skip-docs] 2026-06-30 13:43:52 +02:00
judge-bakeoff-report-v2-g5gold.json feat(ms-ai-architect): G5 gull-friskhets-mikropass LUKKET — 2 gull-feil rettet (genaiops#2, model-selection#8), v3 REHABILITERT — slår v2 på fersk gull (P 89.7/R 92.1 vs 86.8/86.8); adopsjonsbeslutning reversert [skip-docs] 2026-06-30 11:21:45 +02:00
judge-bakeoff-report-v2-g5gold.md feat(ms-ai-architect): G5 gull-friskhets-mikropass LUKKET — 2 gull-feil rettet (genaiops#2, model-selection#8), v3 REHABILITERT — slår v2 på fersk gull (P 89.7/R 92.1 vs 86.8/86.8); adopsjonsbeslutning reversert [skip-docs] 2026-06-30 11:21:45 +02:00
judge-bakeoff-report-v2-reconciled.json feat(ms-ai-architect): Spor 2b gull-rekonsiliering — 12 uenigheter løst, fasit herdet (P 84→92%, R 84→88%) [skip-docs] 2026-06-30 07:20:21 +02:00
judge-bakeoff-report-v2-reconciled.md feat(ms-ai-architect): Spor 2b gull-rekonsiliering — 12 uenigheter løst, fasit herdet (P 84→92%, R 84→88%) [skip-docs] 2026-06-30 07:20:21 +02:00
judge-bakeoff-report-v2.json feat(ms-ai-architect): S1 v2 targeted iteration — GATE PASS (recall 84.2%, precision 84.2%) [skip-docs] 2026-06-26 21:23:50 +02:00
judge-bakeoff-report-v2.md feat(ms-ai-architect): S1 v2 targeted iteration — GATE PASS (recall 84.2%, precision 84.2%) [skip-docs] 2026-06-26 21:23:50 +02:00
judge-bakeoff-report-v3-g5bgold.json feat(ms-ai-architect): G5b gull-friskhets-spot-sjekk LUKKET — 4 v3-FP re-adjudert mot live, ALLE stale gull (v3 flagget korrekt), baseline løftet v3 P89.7/R92.1 → P100/R92.9/0FP; v3.1 forfattet (ren recall-hardning, FP-vakt droppet) [skip-docs] 2026-06-30 13:43:52 +02:00
judge-bakeoff-report-v3-g5bgold.md feat(ms-ai-architect): G5b gull-friskhets-spot-sjekk LUKKET — 4 v3-FP re-adjudert mot live, ALLE stale gull (v3 flagget korrekt), baseline løftet v3 P89.7/R92.1 → P100/R92.9/0FP; v3.1 forfattet (ren recall-hardning, FP-vakt droppet) [skip-docs] 2026-06-30 13:43:52 +02:00
judge-bakeoff-report-v3-g5gold.json feat(ms-ai-architect): G5 gull-friskhets-mikropass LUKKET — 2 gull-feil rettet (genaiops#2, model-selection#8), v3 REHABILITERT — slår v2 på fersk gull (P 89.7/R 92.1 vs 86.8/86.8); adopsjonsbeslutning reversert [skip-docs] 2026-06-30 11:21:45 +02:00
judge-bakeoff-report-v3-g5gold.md feat(ms-ai-architect): G5 gull-friskhets-mikropass LUKKET — 2 gull-feil rettet (genaiops#2, model-selection#8), v3 REHABILITERT — slår v2 på fersk gull (P 89.7/R 92.1 vs 86.8/86.8); adopsjonsbeslutning reversert [skip-docs] 2026-06-30 11:21:45 +02:00
judge-bakeoff-report-v3.1.json feat(ms-ai-architect): G1 LUKKET — v3.1 judge MÅLT + ADOPTERT (P100/R100/0FP/0FN, max-utfall) 2026-06-30 21:33:45 +02:00
judge-bakeoff-report-v3.1.md feat(ms-ai-architect): G1 LUKKET — v3.1 judge MÅLT + ADOPTERT (P100/R100/0FP/0FN, max-utfall) 2026-06-30 21:33:45 +02:00
judge-bakeoff-report-v3.json feat(ms-ai-architect): G1 v3 bake-off MÅLT — v3 regredierte (P 92.1→89.7, R flat), v2 beholdt; G5 gull-friskhet åpnet [skip-docs] 2026-06-30 10:54:39 +02:00
judge-bakeoff-report-v3.md feat(ms-ai-architect): G1 v3 bake-off MÅLT — v3 regredierte (P 92.1→89.7, R flat), v2 beholdt; G5 gull-friskhet åpnet [skip-docs] 2026-06-30 10:54:39 +02:00
judge-bakeoff-report.json feat(ms-ai-architect): S1 judge bake-off RESULT — GATE FAIL (recall 68.4% < 80%) [skip-docs] 2026-06-26 20:45:09 +02:00
judge-bakeoff-report.md feat(ms-ai-architect): S1 judge bake-off RESULT — GATE FAIL (recall 68.4% < 80%) [skip-docs] 2026-06-26 20:45:09 +02:00
judge-bakeoff-results-v2.json feat(ms-ai-architect): S1 v2 targeted iteration — GATE PASS (recall 84.2%, precision 84.2%) [skip-docs] 2026-06-26 21:23:50 +02:00
judge-bakeoff-results-v3.1.json feat(ms-ai-architect): G1 LUKKET — v3.1 judge MÅLT + ADOPTERT (P100/R100/0FP/0FN, max-utfall) 2026-06-30 21:33:45 +02:00
judge-bakeoff-results-v3.json feat(ms-ai-architect): G1 v3 bake-off MÅLT — v3 regredierte (P 92.1→89.7, R flat), v2 beholdt; G5 gull-friskhet åpnet [skip-docs] 2026-06-30 10:54:39 +02:00
judge-bakeoff-results.json feat(ms-ai-architect): S1 judge bake-off RESULT — GATE FAIL (recall 68.4% < 80%) [skip-docs] 2026-06-26 20:45:09 +02:00
judge-pass-manifest.json feat(ms-ai-architect): R7.5 KOMPLETT 51/51 — payload-31..51 dømt+ingestet, re-judge-gate bestått, async-processing stemplet [skip-docs] 2026-08-03 15:56:52 +02:00
judge-results.json feat(ms-ai-architect): Spor D steg A — eng+infra K10-fix → korpus-invariant ≥90 oppfylt 2026-06-23 17:56:43 +02:00
k1-trigger-prompts.json fix(ms-ai-architect): Sesjon 11 — K1 trigger-presisjon, blindet judge PASS alle 5 2026-06-20 10:00:47 +02:00
r11-footer-class-2026-08-11.json docs(ms-ai-architect): footer-klassen handklassifisert — 58 medlemmer, en fjerde unnslippsform, og «alle avvik samme vei» falt 2026-08-11 21:52:19 +02:00
r11-pilot-classification.json fix(ms-ai-architect): 58-klassen er lukket — og den siste keep-linja var usann 2026-08-12 20:16:46 +02:00
r71-payloads.json feat(ms-ai-architect): R7.1 — judge-pass 30/45 filer (362/544 claims; 1 pass, 29 flagged, 106 flagg; v3.1-judge, ledger durabel per fil) [skip-docs] 2026-07-18 17:34:49 +02:00
r72-payloads.json fix(ms-ai-architect): 58-klassen er lukket — og den siste keep-linja var usann 2026-08-12 20:16:46 +02:00
r73-payloads.json fix(ms-ai-architect): 58-klassen er lukket — og den siste keep-linja var usann 2026-08-12 20:16:46 +02:00
r74-payloads.json fix(ms-ai-architect): 58-klassen er lukket — og den siste keep-linja var usann 2026-08-12 20:16:46 +02:00
r75-payloads.json fix(ms-ai-architect): 58-klassen er lukket — og den siste keep-linja var usann 2026-08-12 20:16:46 +02:00
spor0-fix-manifest.json fix(ms-ai-architect): R5 G5b — 4 innholds-fikser (retired gpt-35-turbo→gpt-4o-mini, vector-quant GA 2024-07-01, 2 overclaims nyansert), hver live-verifisert per MS Learn-kilde [skip-docs] 2026-07-04 17:09:23 +02:00