Commit graph

57 commits

Author SHA1 Message Date
795d494781 fix(ms-ai-architect): idx-26j locator 5 fikk anker — jeg gjorde den aktuell uten aa gi maskinen grep paa den
96639f7 flyttet idx-26j sin femte locator fra 'adjudicated OUT OF SCOPE' til 'anvend
den ratifiserte formen eller diverger bevisst'. Det gjorde den AKTUELL. Men entryens
anchors var fortsatt de tre den ble reist med - **Status:** GA var ikke blant dem.

DERFOR SAA INGEN AV DE TO GATENE DET: check-g7-queue.mjs gav exit 0 og suiten 1047/1047,
fordi begge validerer ankerne som FINNES. En locator som bare lever i prosa er usynlig
for dem. En sesjon kunne lukket 26j mot sine tre ankrede locatorer, skrevet en
resolution, og latt linje 4 i transparency-documentation-standards.md staa paa 'GA' -
'finne er ikke aa lukke loopen', ett hopp nedstroms, i min egen edit.

**Status:** GA lagt til som fjerde anker. Verifisert unik i fila (1 forekomst, linje 4)
foer den ble lagt til.

OGSAA BOKFOERT I idx-26g SIN RESOLUTION: stempelet ved siden av kilde-editene er
ADJUDISERT, ikke latt staa tvetydig. *(Verified MCP 2026-04)* paa linje 795 naar IKKE
Kilder-seksjonen, saa kilde #9 (datert 2026-08-09), rettingen av #1 og renummereringen
sto under INTET stempel. Maalt, ikke antatt: hvert Confidence-stempel i fila er
seksjons-terminalt, rett foer neste ##-heading (seks forekomster - 328 foer
Beslutningsveiledning, 659 foer For arkitekten, 795 foer Kilder og verifisering), saa
795 er terminalt for 'For arkitekten (Cosmo)'. Uavhengig bekreftelse: kilde 1-8 baerer
'Verifisert: 2026-02', som et dekkende 2026-04-stempel ville motsagt.

Null-kryssreferanse-grepen ogsaa kjort over linje 795-EOF (fotteksten etter lista,
inkl. **Confidence vurdering**) - null treff der ogsaa, saa paastanden dekker hele fila
og ikke bare vinduet jeg forst sjekket.

Koe: 8 aapne / 11 resolved. g7-queue-tester 15/15.

[skip-docs]
2026-08-09 12:47:16 +02:00
96639f7e52 fix(ms-ai-architect): G7 idx-26g lukket — og §9.12s egen korpusmaaling var tatt over feil populasjon
Header **Status:** GA -> GA / Preview (Responsible AI scorecard). Begge kildesidene
bekreftet ordrett ved live fetch: 'currently in public preview ... provided without a
service-level agreement, and we don't recommend it for production workloads'. Begge
titlene sier '(preview)'. Formen valgt etter aa ha sjekket alle seks korpusfilene i
X / Preview (Y)-familien: parentesen navngir alltid det som ER i preview, aldri
GA-flaten.

DE TO BESLUTNINGENE VAR UAVHENGIGE, OG ENTRYEN BUNTET DEM. Banneret staar paa
concept-siden, som ALLEREDE er filas Kilder #1 - saa preview-faktumet trengte ingen
ny kilde. Bare de sju segmentene trengte how-to-siden. Delt opp i ratifiseringen slik
at en kildebeslutning ikke gated en status-retting.

STEMPELET RE-DATERT BEVISST 2026-08-04 -> 2026-08-09. En setning skrevet i dag under
et fem dager gammelt verifiseringsstempel er nettopp idx-26h-defekten ('stempelet var
FEIL DA DET BLE SATT, ikke foreldet') - denne gangen forfattet av editen selv.
Re-datering paastaar hele §1, saa hele §1 ble re-maalt mot begge live-sidene.

TREDJE LOCATOR, IKKE NAVNGITT AV ENTRYEN (ankere er en NEDRE grense, tiende gang):
Kilder #1 sa 'Status: GA (public preview for some features)' to linjer under sin egen
tittel som slutter paa '(preview)'. Banneret dekker hele funksjonen -> falskt, ikke
bare upresist.

Kilde #9 lagt til, 9-15 renummerert 10-16, Total kilder 15 -> 16. Trygt paa maaling:
grep over linje 1-794 gav NULL prosa-kryssreferanser til kildenummer. Formen bevarer
ogsaa telle-paastandens referent (teller entries, 16 entries / 9 URL-er), mens
'andre URL under #1' ville gitt 16 URL-er mot 15 entries - klassen idx-26j nettopp
bokfoerte.

RETTELSE: §9.12 (og idx-26j locator 5, og STATE) maalte **Status:** over ALLE 434
forekomster under skills/*/references/ - som blander header-feltet paa linje 4 med 47
SEKSJONSNIVAA-linjer i filkropper. To felt, to referenter, ett tall. Header-feltet
alene (FNR<=10): 387 forekomster / 389 filer, 69 distinkte. GA 249 (ikke 252),
Preview 1 (ikke 2), Komplett 1 (ikke 2). To-vokabular-funnet OVERLEVER rettelsen.
Konsekvensen gjoer det ikke: 'setter konvensjonen for 389 filer ved uhell' er FALSK -
69 distinkte verdier, ~44 singletons, 35+ sammensatte GA/Preview-former. En sann
sammensatt verdi SLUTTER SEG TIL etablert praksis. Paastanden som staar er smalere:
fila hadde alt valgt produkttilgjengelighets-aksen, og editen gjorde dens valgte akse
sann.

Bokfoert, ikke reparert: idx-26k (denne filas fottekst, 3+2+1=6 - samme klasse som
idx-26j locator 1, som BEKREFTER som maalt det 26j bare kunne kalle sannsynlig) +
idx-26j re-scopet (locator 5 er ikke lenger blokkert paa korpusbeslutning; formen er
naa presedens). **Last updated:** urort - verifisert at null av elleve tidligere
ratifiserte korpus-editer rorte feltet.

Koe: 8 aapne / 11 resolved. Suite 1047/1047.

[skip-docs]
2026-08-09 12:40:05 +02:00
0470674801 fix(ms-ai-architect): idx-26j presisert — 80/20-funnet forutsatte en nevner det selv kaller udefinert
To rettelser i bokfoeringen, ingen endring i korpuset.

1. 80/20-PAASTANDEN MOTSA SEG SELV. Entryen sa samtidig at fottekstens referent
er udefinert OG at 80/20 'matcher hverken 10/5 foer eller 12/5 etter' - et
konkret avvik regnet ut fra én ANTATT nevner. Soesterfila teller samme slags
paastand paa en annen partisjon ('15 (8 verified fra MCP, 7 baseline/code
samples)' folder code samples inn paa baseline-siden og teller ikke
listeposisjoner). Omskrevet: defekten er at linja ikke KAN sjekkes, ikke at et
bestemt tall spriker. Ikke 'fiks' prosentene mot en antatt nevner - avgjoer
referenten foerst.

2. 'Status: GA' PAA LINJE 4 ER ADJUDISERT, IKKE OVERSETT. idx-26g advarer neste
leser mot aa triagere denne klassen som sitat-hygiene, og samme streng staar i
fila denne oekten nettopp stemplet. Den er IKKE falsifisert av stempelet: linje 4
ligger i bold-label-headeren over '## Innhold', og filas foerste Confidence-
stempel er seksjons-terminalt paa :59.

MEN det egentlige funnet er stoerre enn begge filene: feltets referent er
udefinert KORPUS-BREDT. Maalt over skills/*/references/ blander '**Status:**' to
vokabularer som svarer paa ulike spoersmaal - dokumentmodenhet (Established
Practice 43, Gjeldende 18, Reference 7, Komplett 2) og produkttilgjengelighet
(GA 252, Preview 2, 'GA - avvikles 31. mars 2029' 2). Korpuset baerer alt
presedensformen for en fil som spenner begge: 'GA / Preview (varies by feature)'
(2 filer). Denne fila spenner Transparency Notes (GA), Model Cards (praksis) og
scorecard-en (public preview) samtidig.

Konsekvens for idx-26g: header-spoersmaalet er ikke fil-lokalt. Aa avgjoere det
én fil om gangen setter konvensjonen for 389 filer ved uhell.

Suite 1047/1047. Koe: 8 aapne / 10 resolved.
2026-08-09 10:24:07 +02:00
99675d576c fix(ms-ai-architect): G7 idx-26h lukket — entryen overdrev sin egen dekning, og stempelet satte scopet
Status-linja sa 'anbefalt for production use med awareness om SLA-limitations'.
Tre MS Learn-sider sier ordrett det motsatte: 'provided without a service-level
agreement, and we don't recommend it for production workloads'. Erstattet med
kildens egen ordlyd, ikke slettet - preview-status er seksjonens eneste
operativt avgjoerende faktum og staar ingen andre steder i den.

ENTRYENS ANDRE FUNN VAR FALSKT. Den sier 'neither source page states either' om
Customization-punktene. Det holder for de TO sidene entryen maalte, og faller mot
en tredje: how-to-responsible-ai-insights-ui dokumenterer konfigurasjonen direkte
(steg 4 'enables cohort analysis' + 'features of interest'; steg 1 'an optional
description about the model's functionality'). Punktene var altsaa BELAGT INNHOLD
MED UKILDET ORDLYD - reparasjonen er reformulering, ikke sletting. Bare 'identified
risk groups' og 'decisions og mitigations' var ukildet. 9.11-lærdommen gjentok seg
med entryen selv som den som overpaastod.

STEMPELET SATTE SCOPET, ikke preferanse. Aa datere 'Verified' til 2026-08-09
paastaar at HELE seksjonen er verifisert, saa to locatorer entryen ikke navnga
maatte ogsaa lukkes (operatoerratifisert hver for seg): 'max error rate per
subgroup' (maalverdier settes paa metrikken; fairness-maal fanger differanse
eller forhold PAA TVERS av undergrupper) og rad-en 'Compliance officers | ...
(EU AI Act, sector-specific regler)' (verken rollenavnet eller parentesen finnes
i kilden).

Stempelet var FEIL DA DET BLE SATT, ikke foreldet: Status-linja var usann
2026-08-03, dagen idx-26d daterte stempelet over den.

LABELEN, IKKE PREVIEWET: den ratifiserte previewet slo Auditors-raden inn i
Risk officers-raden; labelen sa 'rett raden', entall. Auditors-raden er belagt
ordrett i konsept-siden og staar urort.

Kilder: begge how-to-sidene lagt inn som #11-12, gamle 11-15 renummerert 13-17,
'Unique sources: 15 URLs' -> 17. Ingen prosa i fila kryss-refererer kildenummer
(verifisert med grep).

RETTELSE: oektens egen ratifiseringsprompt paastod at editen ogsaa lukker
idx-26g. Det gjoer den ikke - 26g er bokfoert mot en ANNEN fil
(stakeholder-communication-ai-decisions.md), med egen kildeliste, egen
telle-paastand og et 'Status: GA'-funn denne editen ikke roerer. Renummereringen
var uansett riktig for DENNE fila, saa editen staar, men spoersmaalet var galt.

Bokfoert som idx-26j: fottekstens proveniens-blokk (3+2+1 = 6, ikke 5; udefinert
referent; 80/20 matcher hverken 10/5 foer eller 12/5 etter) + dialekt-paret
'model-' mot ratifisert 'modell-' som denne editen selv innfoerte.

Suite 1047/1047. Koe: 8 aapne / 10 resolved.
2026-08-09 10:14:47 +02:00
4032dfcd43 fix(ms-ai-architect): idx-26e-resolutionen overdrev sin egen dekning — rettet med datert tilleggsklausul
Resolutionen sa at alle fire 'Verdi for ikke-tekniske'-bullets var lest og
belagt av konsept-siden. Tre av dem er det. Den fjerde - 'Standardisert format
som business forstaar' - er det ikke: ingen av sidene kaller scorecard-en et
standardisert format, og 'business forstaar' er en parafrase av 'share the
report with your technical and nontechnical stakeholders'.

Det er 26f-klassen reprodusert INNE i et resolution-felt: umaalt innhold adoptert
under en verifikasjonspaastand. Korpusteksten er uendret; det som endres er hva
artefaktet paastaar om den. Ingen maskinsjekk leser et resolution-felt.

Originalen er ikke omskrevet - datert tilleggsklausul, samme mekanisme idx-26d
brukte da idx-26f gikk foran den.

I tillegg: idx-26g har faatt en SEVERITY NOTE foerst i summary. 'Status: GA' er en
FALSK statuspaastand av samme klasse som idx-26h-s 'anbefalt for production use',
ikke bare et manglende banner. Uten den lesningen ville neste oekt triagert 26g
under 26h som ren sitat-hygiene.

Suite 1047/1047. Koe: 8 aapne / 9 resolved.
2026-08-04 09:52:26 +02:00
08f31250c4 fix(ms-ai-architect): G7 idx-26e lukket — grunnen til at den ble bokfoert separat var falsk
Lista i stakeholder-communication-ai-decisions.md er kanonisert etter soesterfilas
struktur: sju kildenavngitte segmenter under 'Komponenter i Scorecard', pluss en egen
'Du konfigurerer'-linje som kun baerer det kildene faktisk sier brukeren setter.
Stempelet paa linje 81 datert til 2026-08-04 (operatoervalg, idx-26-presedens).

Premisset som begrunnet SEPARAT bokfoering var falskt. Baade STATE-spoersmaal #9 og
entryens ramme sa 'fil UTEN Verified-stempel over lista' - stempelet paa :81 er
seksjons-terminalt og lukker linje 46-81, altsaa ogsaa lista. AA verifisere en entrys
paastand og aa verifisere GRUNNEN til at den ble bokfoert er to ulike sjekker.

To kildesider, og aa maale mot bare den ene ville produsert to falske funn.
Segmentene staar paa how-to-siden; fila siterer selv konsept-siden, som viser seg aa
belegge 'multi-stakeholder alignment', 'risikoofficerer' OG konfigurerbarheten
naer-ordrett. Siden et krav kom fra og siden fila siterer er ulike objekter.

Aa bare re-merke de fem til 'Komponenter' ble forkastet paa maaling: en femmedlems
komponent-liste er nettopp completeness-defekten idx-26c lukket i soesterfila.
Reparasjonen ville importert en soester-entrys allerede lukkede defekt.

Kompositum-auditen ble kjoert denne gangen (80e17ec eksisterer fordi den ikke ble
det): target-verdiene 3x, fairness-maalverdiene 2x, ingen hybrid.

Tre naboer bokfoert, ikke feid inn:
- idx-26g: §1 utelater public-preview-banneret begge kilder baerer, mens fil-headeren
  sier Status: GA; og how-to-siden staar ikke blant fila sine femten kilder.
- idx-26h: soesterfilas Status-linje ANBEFALER det kilden eksplisitt fraraader
  ('anbefalt for production use' vs 'we don't recommend it for production workloads'),
  under samme stempel idx-26d daterte og idx-26f utvidet. idx-26f-resolutionen sier at
  ingen unntak er skrevet ned for at stempelet skal vaere aerlig - sant om
  enumerasjonen den maalte, ikke om resten av blokka stempelet lukker.
- idx-26i: funn om SJEKKEN. idx-26f grep etter '(gender, ethnicity, age)' og fikk null;
  samme spesifisitet finnes som '(kjoenn, etnisitet, alder)'. En engelsk-bare grep ser
  ikke et tospraaklig korpus' norske halvdel.

Koe: 8 aapne / 9 resolved. Suite 1047/1047.
2026-08-04 09:45:33 +02:00
80e17ec462 fix(ms-ai-architect): idx-26f dialekt-retting — reparasjonen feilet paa sin egen begrunnende akse
Punkt 2 landet som 'fairness-target values', et hybridkompositum som er hverken
norsk eller engelsk, der punkt 1 gjengir samme kildebegrep som 'target-verdiene'.
Dialekt-konsistens var HELE argumentet for aa velge omskriving framfor sletting,
saa reparasjonen feilet paa aksen den ble begrunnet med. Rettet til
'fairness-maalverdiene'.

Koherens-gjennomlesingen etter foerste edit sjekket innholds-samsvar og slapp den
gjennom - den sjekket ikke kompositum-former. En koherens-sjekk arver aksen du
hadde i tankene da du skrev den.

Ratifiseringen laa i LABELEN ('kildens ordlyd i idx-26d-dialekten'); previewet bar
den defekte formen. Labelen er det ratifiserte objektet, saa rettingen krevde ingen
re-ratifisering - men et preview som gjengir labelen feil er en levende maate aa
smugle en uratifisert form forbi en operatoer som leser previewet.

I tillegg: idx-26f-resolutionen skiller naa eksplisitt mellom punkt 2/5 (re-verifisert
denne oekten) og punkt 1/3/6/7 (verifisert under idx-26d samme dag, arvet - ikke
re-kjoert her).

Suite 1047/1047.
2026-08-03 22:32:09 +02:00
9013d250bd fix(ms-ai-architect): G7 idx-27b + idx-26f lukket — scorecard-punkt 2/5 til kildeordlyd, transparensmelding kopiert
idx-27b: Moenster 3-bulleten paastod en 'Powered by AI'-disclosure; erstattet med
den allerede ratifiserte standardmeldingen fra Copilot Studio-seksjonen, grep-
verifisert byte-for-byte. Ingen audience-tiering lagt til (scope-klassen fra 66fb567).

idx-26f: punkt 2 og 5 omskrevet til kildens ordlyd i idx-26d-dialekten framfor ren
sletting av navngitt spesifisitet - den minimale diffen ville etterlatt 'Dataset
statistics' (ogsaa ukildet) og 'across sensitive groups' (gammel dialekt), og dermed
arvet begge defektklassene. Form (b), stempel-innsnevring i fila, avvist av operatoer.

idx-26d-resolutionens sluttklausul supersedert med datert tillegg; idx-27c/27d
bokfoert for to naboer som ikke kunne repareres ved kopi.

Ko: 6 aapne / 8 resolved. Suite 1047/1047.
2026-08-03 22:26:49 +02:00
66fb567ec6 fix(ms-ai-architect): idx-27 scope-addendum — orkestrerings-FAQ-ens rekkevidde skilt fra generative answers
Adversarielt gjenlest resolution avdekket at BEGGE reparerte påstander ble
skrevet inn under overskriften «Microsoft Copilot Studio» uten kvalifikator,
mens FAQ-ens egen scope-linje er «generative orchestration». Samme utvidings-
klasse som idx-27 ble reist for — reprodusert av sin egen reparasjon.

Sjekket mot dokumentasjonen, og de to påstandene falt fra hverandre:
- bekreftelses-sikringen står KUN i orkestrerings-FAQ-en → kvalifikator lagt til
- standardmeldingen står ordrett også i faqs-generative-answers, med bredere
  ramme → raden beholder ingen kvalifikator, og den andre FAQ-en er lagt til
  som sitert kilde så lesningen kan etterprøves

Standing: grounded-as-cited, ikke established-for-all-agents.
Kø: 6 åpne / 6 resolved. Suite 1047/1047.

[skip-docs]
2026-08-03 22:14:42 +02:00
beddba8dd3 fix(ms-ai-architect): G7 idx-26d + idx-27 lukket — scorecard-lista kanonisert, modalitet rettet, FAQ-barnet sitert
idx-26d: alle fem scorecard-navn omdøpt til kildens segmentnavn; beskrivelsene
på punkt 1 (Model Card-innhold) og 3 (dashboard-vokabular) skrevet om. Punkt
2/4/5 bevisst urørt — deres ubelagte spesifisitet er egen klasse (idx-26f).

idx-27: åpent spørsmål #8 besvart NEI (hub-barn teller ikke som kilden).
Løst ved å SITERE barnet i stedet: faqs-generative-orchestration lagt til.
Chat interface-raden bærer nå kildens faktiske standardmelding; Plugin
actions FLYTTET ut av Built-in-tabellen fordi den er maker-konfigurerbar —
å svekke overskriften eller legge til en modalitets-kolonne ville laget nye
ubekreftede påstander om to umålte rader.

idx-26c: falsk locator («linje 129») rettet i køa; stempelet er linje 131.

Tre nye entries: idx-27b, idx-26e (funnet av kryss-fil-grep FØR editen),
idx-26f. Kø: 6 åpne / 6 resolved. Suite 1047/1047.

[skip-docs]
2026-08-03 22:09:17 +02:00
63644c1791 fix(ms-ai-architect): G7 idx-26b + idx-26c lukket — segmentnavn rettet, enumerasjonen komplettert
Kilden re-hentet live for skriving; §9.7 behandlet som premiss, ikke faktum.
how-to-responsible-ai-scorecard enumererer SJU segmenter og navngir
accuracy-segmentet 'model performance'. Begge malingene bekreftet uavhengig.

idx-26b (ratifisert form a: rename framfor fjerning): Accuracy metrics-raden
leser na 'Responsible AI Scorecard: model performance'. Sletting var
tilgjengelig og avvist — EU AI Act-mappingen er ekte og kildestottet, sa a
fjerne raden ville kastet sann informasjon for a reparere en navnedefekt.

idx-26c (ratifisert form a: legg til framfor nedgrader): 'Model performance' og
'Cohorts' lagt til som punkt 6-7; de fem eksisterende urort, sa endringen er
begrenset til det malte gapet. Punkt 7 formulert 'automatisk uttrukket' for a
holde det atskilt fra Cohort analysis i Customization-blokka, som er
operator-definert og ikke enumererer et segment.

STATE-PAASTAND FALSIFISERT: 'ankeret SKAL slutte a matche, ellers feiler
sjekken' er feil. lib/g7-queue.mjs:69-75 returnerer FOR ankersjekken for
resolved; unntaket er totalt, og anker-drift feller kun en entry som star apen.
Ukontrollert ville pastanden tvunget innsetting i kilderekkefolge pa
maskingrunner som ikke finnes. idx-26c er forste resolved entry hvis anker
fortsatt matcher ordrett — unntaket er na utovd for ekte.

To tillitsmarkorer avgjort i motsatt retning: stempelet pa linje 129 beholdt
uendret (scope sjekket; dekker na en komplett sju-punkts enumerasjon
re-verifisert samme dato det allerede barer), stempelet under
compliance-tabellen bevisst IKKE oppgradert (det dekker seks rader, fem umalte).

idx-26d bokfort, ikke foldet inn: parafrase-drift i punkt 1-5 mot kildens
segmentnavn. Den forelaa begge editene — det reparasjonen endret er
SYNLIGHETEN, siden punkt 6-7 barer kildenavn og lista na blander to dialekter.
Full kanonisering ble lagt fram som tredje alternativ og ikke valgt.

Ko: 5 apne / 4 resolved. Suite 1047/1047.
2026-08-03 21:40:21 +02:00
065a55f3c5 docs(ms-ai-architect): idx-26c bokfort — idx 26-reparasjonen gjorde en latent ufullstendighet til en aktiv pastand
Den live-hentingen som lukket idx 26 listet SJU kanoniske scorecard-segmenter.
Lista etter reparasjonen barer fem: model performance og cohorts mangler.
('Cohort analysis' star i Customization-blokka, ikke som enumerert segment, sa
den kurerer ikke utelatelsen.)

For denne okten var det en latent ufullstendighet under et udatert stempel. Ved
a datere stempelet til 2026-08-03 gjorde vi det til en positiv pastand om at
nettopp denne enumerasjonen ble verifisert den dagen — over innhold samme dags
verifisering viste manglet to medlemmer.

Funnet la allerede inne i idx 26s egen resolution, som siterer alle sju mens
fila lister fem. Bokfort framfor a foldes inn: idx 26s ratifiserte scope var
falskheten i item 4 og 5, ikke listas fullstendighet.

Tredje gang pa to okter at defekten la VED SIDEN AV editen framfor I den.

Ogsa markert: sitatblokkens andre setning er utledet fra fravaer i en
enumerasjon, ikke fra en positiv kildepastand — naer sikker, men en slutning.

Ko: 6 apne / 2 resolved. Suite 1047/1047.

[skip-docs]
2026-08-03 21:30:09 +02:00
8cde10f09a fix(ms-ai-architect): G7 idx 26 lukket — scorecard-segmenter rettet, dashboard-komponenter merket
Error analysis og Counterfactual analysis sto som item 4/5 i 'Komponenter i
Scorecard'. Begge kilder hentet live denne okten og bekrefter malingen
uavhengig av 9.6: how-to-responsible-ai-scorecard enumererer summary/model
overview, data analysis, model performance, cohorts, top important factors,
fairness insights og causal insights; concept-responsible-ai-dashboard lister
Error analysis og Counterfactual what-if som *dashboard*-komponenter.

Form (b), operatorratifisert: relabel framfor fjerning. Lista renummererer
rent til 1-5 — 1,2,3,4,6,7-artefakten var tvungen kun inne i delete-only-
konvolutten, ikke for en ordinaer Edit. De to kapabilitetene beholdes i et
sitatblokk eksplisitt merket som dashboard-komponenter, sa kildebekreftet
informasjon overlever og leseren advares mot nettopp den forvekslingen som
skapte defekten. Lokator 2: Risk assessment-raden leser na 'fairness insights'.

Confidence-stempelet tolv linjer under vouchet for den falske lista og la
utenfor enhver maskinsjekk (V1/V2/V2b/V3 er strenginvarianter; check-g7-queue
tester kun ankere). Beholdt, men datert 2026-08-03 for a fore re-verifiseringen.
Dokument-koherens lest etter editen (c569bdc-laerdommen).

Nabodefekt funnet av filsveipet bokfort separat som idx-26b, ikke foldet inn:
'Quantitative analyses' attribueres til Scorecard, men er en Model Card-seksjon
(samme fil, linje 77) — kryss-attribuering mellom to standarder.

Suite 1047/1047.

[skip-docs]
2026-08-03 21:23:35 +02:00
59c6c280b1 feat(ms-ai-architect): G7 lukket som mekanisme — navngitt review-kø (form b), valgt på måling
Operatør-ratifisert 2026-08-03. G7 var gapet for korreksjoner som er RIKTIGE
men større enn O2-konvolutten (én lokator + kun-sletting). Uten eier falt de
stille ut: O2-triagen avviser dem, O3 dekker dem ikke, og review-sporet hadde
ingen inngangskø.

Formvalget ble tatt på §9.6-målingen, ikke på preferanse:
- 2 av 4 anvendte subtraksjoner etterlot en rest -> rester er delete-only-
  konvoluttens NORMALE biprodukt, ikke et unntak.
- 2 av 5 medlemmer (idx 17, 33) er ERSTATNINGER, ikke fler-lokator. En
  delete-orientert O4-klasse med egen retur-kontrakt ville ikke fikset dem —
  altså feil dimensjonert mot evidensen. Køen absorberer begge klasser.

Artefakter (TDD, test-først):
- data/g7-review-queue.json — 6 entries, tracked
- lib/g7-queue.mjs — validateQueue, lukkede vokabular
- check-g7-queue.mjs — exit 1 ved drift eller skjemafeil
- tests/kb-eval/test-g7-queue.test.mjs — 15 tester

Kontrakten: ankere er ORDRETTE strenger, aldri linjenummer (line != real_line
i 9 av 17 R11-records). En åpen entry hvis anker slutter å matche gir
anchor_drift og exit 1 — den kan ikke falle stille ut, som er hele hensikten.
En resolved entry MÅ føre resolution, ellers er "resolved" ikke til å skille
fra "stille droppet". Ingenting i køen er maskin-anvendbart per definisjon.

Innhold: 5 åpne (26, 27, 33, 36, 18), 1 lukket (17). idx 27 kom hit ved å
falle ut av O2 på cond 3; idx 26 ved operatørens avvisning av delvis fiks.

Suite 1047/1047. [skip-docs]
2026-08-03 21:10:00 +02:00
94c99c46dd feat(ms-ai-architect): R11 §10 måling #2 bølge 2 — alle 46 R8-enumerasjoner klassifisert [skip-docs]
Fire subagenter til (idx 25-46), samme rammer: read-only, ingen writes/commits,
ingen web-oppslag, evidence_quote som eneste kilde. To presiseringer i prompten
etter bølge 1: forslaget må være oppnåelig ved kun sletting (behov for
omskriving er i seg selv O3-bevis), og eksplisitt leveringsplikt.

Totalt 46/46: 17 O2-kandidater, 29 O3, 0 locator-bom.
Maskin-verifikasjon: 46/46 passerer V1 (ordrett filtekst), 16 av 17 O2-forslag
passerer V2+V2b; ett flagget (idx 14, rekapitalisering).

Alle 29 O3-er felles av betingelse 3 — kilden leverer en korrigert verdi.
2026-08-03 17:36:29 +02:00
b174db0936 feat(ms-ai-architect): R11 §10 måling #2 bølge 1 — 24 av 46 R8-enumerasjoner prosa-klassifisert [skip-docs]
Fire subagenter (Opus, read-only, ingen writes/commits, ingen web-oppslag)
klassifiserte idx 1-24 mot §5s tre O2-betingelser. Returene er evidens, ikke
regenererbare, og lagres derfor tracked etter samme mønster som fase0-returns.

Maskin-verifikasjon av returene (V1/V2/V2b):
- V1: alle 24 file_text_verbatim finnes ordrett i de faktiske filene (æøå og
  markup intakt) — oppfunnet tekst ville ryket her.
- V2: alle O2-forslag er deletion-only mot den teksten.
- V2b: ett flagg (idx 14) — 'Automatically add' -> 'Add' er en rekapitalisering,
  altså en tekstendring og ikke ren fjerning. Går til menneskelig review.

Bølge 1: 7 O2-kandidater, 17 O3, 0 locator-bom.
2026-08-03 17:30:20 +02:00
8b270fbe99 feat(ms-ai-architect): R7.5 KOMPLETT 51/51 — payload-31..51 dømt+ingestet, re-judge-gate bestått, async-processing stemplet [skip-docs]
De siste 21 R7.5-filene (payload-31..51) dømt i to parallelle arbeider-tabber,
integrert serielt her.

- 375 claims, 82 flagg (64 not_grounded + 18 source_silent)
- Ledger 222 → 243 records (229 flagged / 14 pass), flagg 902 → 984
- R7.5-batch 30 → 51 = full-pass-worklisten dømt ferdig

Verifisering før ingest:
- Egen telling per fil mot dry-run: 21/21 eksakt match
- ID-fidelitet mot r75-claims-manifest.json: 21/21 eksakt, riktig rekkefølge
- Fold-grep begge dialekter over 375 reason-felt: 0 treff
- Mot HEAD: 0 records tapt, 0 eksisterende records endret

result-38 (async-processing-patterns.md) var eneste pass-record. Re-judge-gate
kjørt før stempling med blind dommer (forbud mot å lese results/ og manifestet):
15/15 grounded, per-claim enighet med originalen, flere dommer nådd via andre
kildesider. ENIGHET → born-verified stempel påført.

Suite: 947/947.
2026-08-03 15:56:52 +02:00
353b976425 feat(ms-ai-architect): R7.5 bølge 3 — payload-21..30 dømt+ingestet (206 claims, 48 flagg; ledger 212→222) [skip-docs] 2026-08-01 20:48:15 +02:00
8ac64e407a feat(ms-ai-architect): R7.5 bølge 2 — payload-11..20 dømt+ingestet (209 claims, 51 flagg; ledger 202→212) [skip-docs]
Ti dommere (R75J-11..20) kjørt parallelt med live MS Learn-fetch per claim.
Alle ti returnerte, validerte 10/10 mot slot + claim-id-sett, og ingen
foldet ASCII — verifisert mot BEGGE dialektene (ae/oe og enkelt-vokal a/o),
0 treff. Mot 2/10 foldet i bølge 1 med samme modell og effort; forskjellen
er den skjerpede prompten med eksempler på begge foldemønstre.

Ingen pass-record i bølgen, så ingen re-judge-gate og ingen stempling —
manifestet er eneste endrede fil.

- 11 model-fingerprinting-watermarking.md ......... 21 claims,  7 flagg
- 12 norwegian-content-safety.md .................. 23 claims,  5 flagg
- 13 output-validation-grounding-verification.md .. 19 claims,  3 flagg
- 14 owasp-llm-top10-azure-mitigations.md ......... 18 claims,  2 flagg
- 15 pii-detection-norwegian-context.md ........... 19 claims,  4 flagg
- 16 prompt-injection-defense-patterns.md ......... 14 claims,  3 flagg
- 17 security-copilot-integration.md .............. 34 claims,  9 flagg
- 18 security-scoring-rubrics-6x5.md .............. 21 claims,  4 flagg
- 19 supply-chain-security-ai-models.md ........... 17 claims,  9 flagg
- 20 ai-builder-credits-transition.md ............. 23 claims,  5 flagg

Ingest dry-run kryssjekket mot egen telling fil for fil før ekte ingest.
Judge-dato 2026-08-01 (reell dato, ÅS#1) lagt inn for slot 11-20.

Ledger 202→212 records (199 flagged + 13 pass), 803→854 flagg.
R7.5: 20/51 dømt. Suite 947/947.
2026-08-01 20:21:06 +02:00
330d8199bb feat(ms-ai-architect): R7.5 steg 1 — re-judge-gate bestått + dommer 03/08 re-kjørt og ingestet (ledger 200→202, 803 flagg) [skip-docs]
Re-judge-gate for disconnected-ai-scenarios.md (eneste pass i bølge 1):
blind dommer R75G-01 (forbud mot å lese r75/results/ og manifestet) ga
19/19 grounded — identisk med originalen på hver claim-id, 0 uenigheter.
ENIGHET → apply-verified-stamp.mjs dry-run bekreftet «would stamp: 1»,
deretter --write (1 stamped, 12 already stamped, 0 failed). KB-diffen er
kun de to stempel-linjene, kroppen byte-identisk.

Dommer 03 og 08 re-kjørt med nye agentnavn (R75J-03b, R75J-08b) etter at
begge foldet ASCII i bølge 1. Begge returnerte æøå intakt — verifisert mot
BEGGE folde-dialektene (ae/oe og enkelt-vokal a/o), 0 treff.

- result-03 ai-incident-response-procedures.md: 21 claims, 12 flagg
- result-08 data-leakage-prevention-ai.md: 27 claims, 9 flagg

Judge-dato satt til reell dato 2026-08-01 for begge (ÅS#1), ikke
batch-identitetsdatoen 2026-07-31 de arvet fra bølge 1.

Ledger 200→202 records (189 flagged + 13 pass), 782→803 flagg.
R7.5: 10/51 dømt. Suite 947/947.
2026-08-01 20:03:33 +02:00
845d8fbdc9 feat(ms-ai-architect): R7.5 extract-fase komplett (51/51, 986 claims) + dømmebølge 1 delvis — 8/10 ingestet (1 pass, 7 flagged, 34 flagg; ledger 192→200) [skip-docs] 2026-07-31 22:14:41 +02:00
f52a486e3a feat(ms-ai-architect): R7.4 KOMPLETT — payload-40..49 dømt+ingestet (170 claims, 36 flagg; ledger 182→192; R7.4 49/49, 923 claims, 236 flagg) [skip-docs]
Bølge 5 avslutter ms-ai-infrastructure/bcdr/ og dermed hele R7.4-batchen.
Ingen pass-record i bølgen, så re-judge-gaten utløses ikke og
apply-verified-stamp.mjs er ikke kjørt (verified uendret på 12).

Dekningskontroll: alle 49 filer i r74-batch.json finnes i ledgeren som
R7.4-records — ingen manglende, ingen ekstra. validate-result.mjs 10/10 OK.
Suite 947/947 grønn.

Pending etter R7.4: 51 filer (R7.5). Flagg totalt 712 → 748.
2026-07-31 21:11:31 +02:00
533d451cd2 feat(ms-ai-architect): R7.4 bølge 4 — payload-30..39 dømt+ingestet (190 claims, 10 flagged/0 pass, 55 flagg; ledger 172→182) [skip-docs]
Avslutter responsible-ai/ (slot 30-33) og starter ms-ai-infrastructure/bcdr/
(slot 34-39). Ingen pass-record, så re-judge-gaten utløses ikke og
apply-verified-stamp.mjs er ikke kjørt (verified uendret på 12).

validate-result.mjs: falsk positiv rettet — «opplyser» sto i
folding-heuristikkens ordliste, men er ordinært norsk uten foldet vokal
(ae/oe/aa) og blokkerte et korrekt result-32. Oppføringen er fjernet med
begrunnelse i koden. Regresjon: alle 39 resultater validerer, og
kontrolltest bekrefter at ekte folding (paa/staar/noeyaktig/loesning/
maaned/ogsaa/naar/aapen/stoette/tjenesteomraade) fortsatt fanges.

Suite 947/947 grønn. R7.4: 39/49 dømt. Flagg totalt 657 → 712.
2026-07-31 20:57:05 +02:00
e017f8bcc2 feat(ms-ai-architect): R7.4 bølge 3 — payload-20..29 dømt+ingestet (245 claims, 10 flagged/0 pass, 72 flagg; ledger 162→172) [skip-docs]
Alle 10 filene i responsible-ai/ dømt av separate Opus-agenter med live
MS Learn-fetch. Ingen pass-record, så re-judge-gaten utløses ikke og
apply-verified-stamp.mjs er ikke kjørt (verified står uendret på 12).

validate-result.mjs: 10/10 OK (slot-binding, claim-id-mengde, lukket
verdikt-sett, folding-heuristikk). Suite 947/947 grønn.

R7.4: 29/49 dømt. Flagg totalt 585 → 657.
2026-07-31 18:30:16 +02:00
3043ff74d4 feat(ms-ai-architect): R7.4 bølge 2 — payload-11..19 dømt+ingestet (153 claims, 9 flagged, 41 flagg; ledger 153→162) [skip-docs] 2026-07-31 16:05:09 +02:00
a7cb4b2bb3 feat(ms-ai-architect): R7.4 bølge 1 — payload-01..10 dømt+ingestet (165 claims, 9 flagged/1 pass, 21 flagg; ledger 143→153) [skip-docs] 2026-07-31 15:49:17 +02:00
1b29e9673a feat(ms-ai-architect): R7.3 KOMPLETT — payload-37/38/39/41/42/43/45/47/48/49 dømt+ingestet (216 claims, 61 flagg; ledger 133→143; R7.3 49/49, 1008 claims, 269 flagg) [skip-docs] 2026-07-25 12:41:36 +02:00
e625645739 feat(ms-ai-architect): R7.3 bølge 4 (delvis) — payload-36/40/44/46 dømt+ingestet (80 claims, 16 flagg; ledger 129→133); 10 dommere døde på session-grensen [skip-docs] 2026-07-25 12:08:33 +02:00
6bfe24c7e2 feat(ms-ai-architect): R7.3 bølge 3 — payload-26..35 dømt+ingestet (193 claims, 10 flagged, 54 flagg; ledger 119→129) [skip-docs] 2026-07-25 08:03:38 +02:00
7011898bd0 feat(ms-ai-architect): R7.3 bølge 2 — payload-16..25 dømt+ingestet (190 claims, 10 flagged, 57 flagg; ledger 109→119) [skip-docs] 2026-07-25 07:50:00 +02:00
c4554708ca feat(ms-ai-architect): R7.3 bølge 1 — payload-06..15 dømt+ingestet (221 claims, 10 flagged, 48 flagg; ledger 99→109) [skip-docs] 2026-07-25 07:36:09 +02:00
80bfd02726 feat(ms-ai-architect): R7.3 start — 49 filer ekstrahert (1008 claims), payloads bygget, 5 dømt+ingestet (ledger 94→99) [skip-docs]
Ekstraksjon komplett for hele R7.3-batchen (neste 49 av 149 pending, worklist-
rekkefølge): 1008 claims over 49 filer, null valideringsfeil. Manifest og 49
v3.1-payloads bygget deterministisk.

Judge-pass startet: 5 filer dømt blindt mot live MS Learn (alle flagged, 33 nye
flagg) og ingestet serielt etter dry-run. Ingen pass-records → verken re-judge-
gate eller stempling utløst.

Ledger: 99 records (R7.1 45 + R7.2 49 + R7.3 5), 88 flagged / 11 pass, 287 flagg.
Suite 947/947.
2026-07-25 07:01:57 +02:00
2935039f44 feat(ms-ai-architect): R7.2 stempling — 9/11 pass born-verified etter re-judge-gate; 2 diskvalifisert → flagged (R11) [skip-docs]
Re-judge-gate (frossen v3.1, 11 blinde Opus-4.8-xhigh subagenter, live MS Learn-fetch,
G6 Layer A dekket alle fetches). Kvalitetsgate på irreversibelt steg: born-verified stempel
krever TO uavhengige alt-grounded pass.

9 ENIGHET (alle claims grounded) → stemplet Verified 2026-07-24 / judge-v3.1:
  apim-azure-front-door-ai, apim-vs-direct-access-comparison, cost-tracking-apim-policies,
  developer-portal-ai-apis, multi-region-ai-gateway-design, streaming-support-apim,
  versioning-ai-api-endpoints, data-versioning-lineage, real-time-streaming-ai

2 UENIGHET (≥1 non-grounded) → pass→flagged, IKKE stemplet (R11 work-list):
  - security-hardening-ai-gateway: #2 source_silent («20+ security policies» usourcet),
    #7 not_grounded R8 (feature = Prompt Injection Protection, ikke «Prompt Shields»;
    indirekte injection-deteksjon ikke dekket)
  - etl-vs-elt-ai: #2 not_grounded R8 (Gold-lag = curated for reports/dashboards, ikke ML-features)

Gaten fanget gull/judge-run-uenighet (jf. gull-friskhet kan invertere adopsjon). Ledger:
94 records, R7.2 9 pass / 40 flagged (validateManifest valid). Stempel = kun Verified/
Verified by-header (body byte-identisk, per-fil invariant-sjekket, atomicWrite). Suite 947/947.
2026-07-24 20:14:45 +02:00
6b457c02e2 feat(ms-ai-architect): R7.1 — judge-pass 45/45 komplett (544 claims; 2 pass, 43 flagged, 152 flagg; v3.1-judge ORDRETT, Opus 4.8 xhigh-fanout; 2 pass-records born-verified stemplet) [skip-docs] 2026-07-23 22:02:38 +02:00
706f44fb34 feat(ms-ai-architect): R7.1 — judge-pass 30/45 filer (362/544 claims; 1 pass, 29 flagged, 106 flagg; v3.1-judge, ledger durabel per fil) [skip-docs] 2026-07-18 17:34:49 +02:00
36fd4cfe7b fix(ms-ai-architect): R5 G5b — 4 innholds-fikser (retired gpt-35-turbo→gpt-4o-mini, vector-quant GA 2024-07-01, 2 overclaims nyansert), hver live-verifisert per MS Learn-kilde [skip-docs] 2026-07-04 17:09:23 +02:00
09bc99eec8 feat(ms-ai-architect): G1 LUKKET — v3.1 judge MÅLT + ADOPTERT (P100/R100/0FP/0FN, max-utfall)
45-veis v3.1 fan-out kjørt per runbook: 255 claims / 45 filer, 45 Opus-4.8-xhigh-
subagenter (live MS Learn, blinde for gull, én per fil), aggregert 255/255 rent →
deterministisk re-score mot G5b-korrigert gull.

Resultat: v3.1 = P 100,0 / R 100,0 / 0 FP / 0 FN / F1 1,000 (TP 42, TN 198) mot
v3-baren P 100,0 / R 92,9 / 3 FN. Alle 3 gjenstående FN fanget (R1 øvre-grense,
R7 last-bærende-streng, R8 fler-delt) UTEN én ny FP. Forhåndsregistrert gate
(hold P=100 ∧ løft R>92,9) klarert → v3.1 ADOPTERT som judge.

R1-«+»-floor-flagg over full populasjon avkreftet som FP-risiko: alle matchet gull
(decision-changing floors = outdated/TP; tette floors = correct/TN). §8 G1 lukket,
G2 avblokkert (v3.1 = prompt å wire i transform.mjs). Suite 641/641. [skip-docs]
2026-06-30 21:33:45 +02:00
045db566ba feat(ms-ai-architect): G5b gull-friskhets-spot-sjekk LUKKET — 4 v3-FP re-adjudert mot live, ALLE stale gull (v3 flagget korrekt), baseline løftet v3 P89.7/R92.1 → P100/R92.9/0FP; v3.1 forfattet (ren recall-hardning, FP-vakt droppet) [skip-docs] 2026-06-30 13:43:52 +02:00
bc3fc85b20 feat(ms-ai-architect): G5 gull-friskhets-mikropass LUKKET — 2 gull-feil rettet (genaiops#2, model-selection#8), v3 REHABILITERT — slår v2 på fersk gull (P 89.7/R 92.1 vs 86.8/86.8); adopsjonsbeslutning reversert [skip-docs] 2026-06-30 11:21:45 +02:00
8ca8f33835 feat(ms-ai-architect): G1 v3 bake-off MÅLT — v3 regredierte (P 92.1→89.7, R flat), v2 beholdt; G5 gull-friskhet åpnet [skip-docs] 2026-06-30 10:54:39 +02:00
9b147b470f feat(ms-ai-architect): G3 gull-intern-konsistens-lint + G4 build-instruks-policy — §8 gap-lukk [skip-docs] 2026-06-30 09:55:15 +02:00
4ab1138760 feat(ms-ai-architect): Spor 2b gull-rekonsiliering — 12 uenigheter løst, fasit herdet (P 84→92%, R 84→88%) [skip-docs]
4 gull-feil rettet (FP1/FP2/FP6/FN1) + 1 note-fiks (FP4); 8 judge-feil dokumentert som kalibreringsmål for Spor 2a/judge-prompt-v3. Hver endring live-belagt mot MS Learn. Nedre-grense-policy vedtatt. 0 uløste uenigheter. Suite 637/637. Logg: docs/ref-kb-gold-reconciliation-2026-06.md; herdet rapport: judge-bakeoff-report-v2-reconciled (frozen v2 beholdt).
2026-06-30 07:20:21 +02:00
2c54f0d5a0 fix(ms-ai-architect): Spor 0 — 37 kilde-verifiserte KB-feil fikset (25 ref-filer), 1 avvist [skip-docs]
Per-kilde verifiserings-agenter (Opus xhigh, live microsoft_docs_fetch) bekreftet
hver verdi mot kilden FOER endring; alle forekomster av samme gale fakta fikset
fil-vidt (ikke bare sitert linje).

- 37/38 confirm-fix anvendt; #8 (model-selection «Model Router GA») AVVIST: fila var
  allerede korrekt (Model Router GA siden 2025-11-18); den siterte model-choice-guide
  har utdatert «(preview)»-etikett. AA «fikse» ville innfoert en feil.
- Tverteklynger reconciled til kilde-sann verdi: AI Search storage (S1 160/S2 512/S3
  1024/L1 2048/L2 4096 GB; vektor 5/35/150/300), Quota Tiers (erstatter
  Default/Enterprise + «1 Unit Capacity»).
- Hoey-innsats: realtime Schrems II omskrevet (global deployment != EU-residens,
  selv-verifisert mot kilde); Data Zone Norway East = gpt-5.4 OG gpt-5.5 (ikke kun
  5.5); computer-use = gpt-5.4 + computer-tool (region flagget for verifisering).
- Suite 552/552 groenn. Manifest oppdatert (fixed/verdict/verified per fiks).

Spor 1-froe (cross-fil-gjentakelser i UBEROERTE filer): «DDoS Protection Standard» i
ros-ai-threat-library.md + zero-trust-ai-services.md. Tilstoetende funn (ikke i de 38):
se docs / STATE.
2026-06-29 09:39:20 +02:00
2b6fb62f53 docs(ms-ai-architect): nær-100% korrekthets-program + kontinuerlig-trust-mekanisme + Spor 0-fiks-manifest [skip-docs]
Operatør-mandat: alle reference-filer 100% til å stole på til enhver tid + mekanisme
som sikrer det. Full kvalitetsoffensiv godkjent (Spor 0 først, så skala).

- docs/ref-kb-correctness-program-2026-06.md: 4 spor + MEKANISMEN (§4) — invariant
  håndhevet av 3 porter (frontmatter-kontrakt / create-time-guard / kadens-judge);
  ærlig tak (sample vs korpus, asymptotisk 100%, pris uverifiserbar); Voyage-plan;
  nordstjerne-verifisering (ferskt gull-utvalg, mål <2% feilrate).
- spor0-fix-manifest.json: 38 deterministiske fikser (25 filer), hver reverify_required.

Spor 0 utføres i fokusert sesjon m/ kilde-reverifisering (kvalitetsbar > hastverk).
2026-06-26 21:37:47 +02:00
4cd290c14b feat(ms-ai-architect): S1 v2 targeted iteration — GATE PASS (recall 84.2%, precision 84.2%) [skip-docs]
Operatørvalg (c): én målrettet, prinsipiell prompt-iterasjon på den diagnostiserte
grounded-men-feil-feilmoden (eksakt-verdi-entailment). Terskel uendret; v1 frosset.

Full blind v2 fan-out (15 batcher Opus 4.8 xhigh, 255 P-påstander dekket):
- judge v2: recall 84.2% (32/38, PASS >=0.80, Wilson [69.6-92.6%]), presisjon 84.2%
  (PASS >=0.70), F1 0.842, slår staleness 0/38.
- Fiksen løste målet: sku recall 37.5%->75.0%, taxonomy 66.7%->100%.
- +6 ekte fangster (26->32) uten netto nye FP (6->6) => recall OG presisjon opp.

Forbehold (ærlig): andre måling på samme frosne sett etter v1 (erkjent); Wilson nedre
grense 69.6% < 0.80 ved n=38; én iterasjon. Gate-logikk => vei mot S3. Stoppet for
operatør-beslutning (S2/S3), eskalerer ikke selv.

run-judge-bakeoff.mjs: --results/--report-prefix flagg (v2 uten å klobbe v1). Suite 552/552.
2026-06-26 21:23:50 +02:00
79e34312ea feat(ms-ai-architect): S1 judge bake-off RESULT — GATE FAIL (recall 68.4% < 80%) [skip-docs]
Blind fan-out: 15 batcher Opus 4.8 xhigh, 255 P-påstander dekket (0 missing/dupes/extra),
hver judget mot live MS Learn via microsoft_docs_fetch (judgen så aldri gull-verdict).

Resultat mot forhåndsregistrert gate (recall >=0.80, presisjon >=0.70):
- judge: presisjon 81.3% (PASS), recall 68.4% (FAIL, Wilson [52.5-80.9%]), F1 0.743, 26/38 fanget
- staleness baseline: recall 0/38 (judge slår den desisivt)
- recall-drag konsentrert: sku 37.5%, taxonomy 66.7%; version/status/tpm allerede 80-86%
- 10/12 bommer var grounded-men-feil (brittle dekomponering, isolert til sku/taxonomy)

Per pre-registrert gate: STOPP, bygg IKKE S3. Fork (operatør) registrert i plan-doc:
(a) honorer FAIL, (b) scoped judge, (c) målrettet iterasjon + re-kjør.
2026-06-26 20:45:09 +02:00
3e39f2df6b feat(ms-ai-architect): S1 judge bake-off harness + forhåndsregistrert gate (TDD) [skip-docs]
Deterministisk de-risk-harness for Fase 3-judgen (kjøres på frosset 373-påstands gull-sett):
- lib/judge-bakeoff.mjs: P-filter (volatil+fetchbar, price ekskl.), confusion-matrix
  for 3 armer (staleness/judge/hybrid), Wilson-bånd, forhåndsregistrert gate. 14 tester.
- extract-judge-claims.mjs: blind manifest (255 påstander, 0 label-lekkasje — testet invariant).
- judge-claim-prompt.md: blind per-påstands groundedness-judge (Opus xhigh, microsoft_docs_fetch).
- run-judge-bakeoff.mjs: join gull+results på id, gate-rapport (.json/.md).

Gate FORHÅNDSREGISTRERT (operatørvalg, før fan-out): recall ≥0.80, presisjon ≥0.70,
OG slår staleness (0/38). Evalueringspop P = 240 verifiserbare, 38 positive.
Suite 551/551 (538 + 13 nye).
2026-06-26 20:10:58 +02:00
49fd18c6d2 feat(ms-ai-architect): Fase 0 steg 3 — base-rate-rapport + GATE: BYGG Fase 3 (scoped/hybrid) [skip-docs]
compute-base-rate.mjs (tynn CLI over testet lib/base-rate.mjs) -> base-rate-report.{json,md}.
373 paastander: verifiserbar feilrate 13,4 % (40/299), Wilson [10,0 %, 17,7 %]; unsourced 19,8 %.
staleness-recall 0/40 = 0 % -> korrekthets-judge er eneste mekanisme som fanger feilene.
Feil konsentrert i fetchbare typer (sku 36 %, version 25 %, tpm 20 %); pris 74 % unsourced -> operatoer-gated.
GATE besluttet i plan-doc: BYGG Fase 3 scoped til fetchbare claim_types (taxonomy/status/version/tpm/sku/region); pris ikke maskinverifiserbar.
2026-06-26 17:15:54 +02:00
6985ed1f5d feat(ms-ai-architect): Fase 0 steg 2 — verifiserings-fan-out (373 påstander) + gull-sett m/ deterministisk lastmod-join + TDD [skip-docs]
15 batcher (Opus 4.8 xhigh, read-only) verifiserte 55 sample-frame-filer mot live
MS Learn (strikt v2 bevis-krav: correct/outdated/wrong krever hentet learn-sitat,
ellers unsourced). 373 påstander: 259 correct, 29 outdated, 11 wrong, 74 unsourced.
40 reelle feil. lastmod_changed joinet i kode (registry sitemap_lastmod vs filens
dato): 0 filer ville staleness-loopen flagget -> alle 40 feil er judge-unike (rå
funn, krever tolkning i base-rate-rapporten). lib/base-rate.mjs (Wilson, lastmod,
aggregering) TDD 15 tester. Suite 538/538. Steg 3 (compute-base-rate + gate) gjenstår.
2026-06-26 15:16:10 +02:00
f7fba5e4e7 feat(ms-ai-architect): Fase 0 steg 1 — deterministisk sample-frame (45 volatil + 10 kontroll) + TDD [skip-docs]
Internt Fase 0-måleverktøy (ingen brukervendt flate: ingen ny kommando/agent/skill).

- build-sample-frame.mjs: volatilitets-scorer (K9-grense for stabile identifikatorer)
  + sti-boost (cost-optimization/platforms) + stratifisering (floor + masse-vektet
  largest-remainder). Deterministisk, ingen Math.random.
- 14 unit-tester (suite 509 -> 523, alle grønne)
- fase0-sample-frame.json: 55 filer fra 306 sourced-populasjon; oversampler
  pris/SKU/TPM/region/versjon/preview-tette filer; kontroll-stratum fra
  responsible-ai/npsg/architecture (stabile påstander)
2026-06-26 14:18:53 +02:00