ms-ai-architect/scripts/kb-eval/judge-prompt.md
Kjell Tore Guttormsen c1f75f9c78 fix(ms-ai-architect): Sesjon 11 — K1 trigger-presisjon, blindet judge PASS alle 5
(a) 2 description-fikser (operatør-godkjent):
- governance: +Schrems II/TIA-trigger (recall-gap 0.85→1.0; governance eier
  domenet — 20 ref-filer + data-residency-audit-monitoring.md)
- advisor: strammere — selection-forankret + eksplisitt negativ scope
  (NOT for build/secure/operate/legally-assess); fjernet bred
  "Microsoft AI architecture"-trigger som kolliderte med søsken

(b) Kuratert testsett + mekanikk:
- ny data/k1-trigger-prompts.json (100 prompts: 10 in + 10 adversarielt out/skill)
- judge-prompt.md K1: generer→konsumer kuratert sett + nytt skjema
  (inDomainHitRate/outDomainFalsePositiveRate/pass/misclassified, provisional=false)
- blindet måling: 5 Opus-dommere ser kun description + 20 stokkede umerkede
  prompts; ground-truth scoret deterministisk utenfor dommeren

Resultat: K1 PASS alle 5 — hit 1.0 / fp 0.0 / presisjon 1.0 / 0 miss.
Begge fikser validert i dommer-begrunnelsene. K2 fortsatt PASS.
Ikke regredert: validate 239 · kb-eval 15 · kb-update 122 · kb-integrity 192/192.

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01REiKFhP4w6xGXXqWKpPCJJ
2026-06-20 10:00:47 +02:00

3.1 KiB
Raw Blame History

LLM-judge-rubrikk (K1/K4/K7/K8/K9) — skill-kvalitet, ms-ai-architect

Pinnet rubrikk for de semantiske eval-kriteriene som ikke kan måles deterministisk. Kjøres som operatør-gated subagent-steg (Opus, én dommer per skill). De deterministiske kriteriene (K2/K3/K5/K6 + ref-tall) måles av eval.mjs; denne dekker resten.

Placeholders: <NAME> = skill-navn, <ROOT> = plugin-rot, <PATH> = sti til SKILL.md.


Du er en skill-kvalitets-dommer (LLM-as-judge) for ms-ai-architect. Vurder skillen <NAME> mot K1/K4/K7/K8/K9. Plugin-rot: <ROOT>. SKILL.md: <PATH>. Referansefiler: <ROOT>/skills/<NAME>/references/.

Les SKILL.md i sin helhet. For K8: sample 5 tilfeldige referansefiler og les headeren deres. Vær streng og adversariell — ikke ros, ikke pynt på tall.

  • K1 trigger-presisjon: last det operatør-kuraterte settet for <NAME> fra <ROOT>/scripts/kb-eval/data/k1-trigger-prompts.json (nøkkel <NAME>: in_domain [10] + out_of_domain [10]). IKKE generer egne prompts. For HVER prompt, avgjør KUN fra description-feltet i <PATH> om skillen burde trigge (ignorer body, ref-filer og intent). Scoring: en in_domain-prompt er en TREFF hvis den trigger; en out_of_domain-prompt er en FALSK POSITIV hvis den trigger. Rapporter inDomainHitRate (treff/10), outDomainFalsePositiveRate (falske positive/10), samlet precision (korrekte/20) og misclassified (list de feilklassifiserte promptene + hvorfor). Settet er operatør-kuratert → sett provisional=false. pass = inDomainHitRate ≥ 0.90 OG outDomainFalsePositiveRate ≤ 0.10.
  • K4 ingen duplisering (SKILL.md ↔ ref-filer): score 15 (5 = ingen duplisering). Finnes detalj i SKILL.md body som dupliserer ref-filer? Gi konkret eksempel. pass = score ≥ 4.
  • K7 imperativ/instruksjons-stil: sample 10 instruksjonssetninger fra body; andel i imperativ/infinitiv. pass = ratio ≥ 0.80.
  • K8 kildehenvisning i ref-filer: for 5 samplede ref-filer, har header Last updated / Verified / kilde-URL? Rapporter andel. pass = ratio ≥ 0.80.
  • K9 ingen VOLATIL tid-sensitiv info i SKILL.md body: finnes volatile påstander DIREKTE i body (ikke i ref-filer) — GA/preview-release-status, modellversjoner, SLA-/ytelses-/pris-tall, regions- tilgjengelighet? List funn. pass = ingen volatile funn. Utenfor scope (ikke funn): stabile identifikatorer som forordningsår (2024/1689), lovsaksnr (C-311/18), standard-versjonsnavn (OWASP LLM Top 10 2025, MADR v3.0), filnavn og generisk forklarende «preview»/«GA» uten konkret produkt-status. Disse er navngitte identifikatorer, ikke ferskhets-sensitive påstander.

RETURNER KUN dette JSON-objektet (ingen annen tekst, ingen markdown-fence):

{"skill":"<NAME>","K1_triggerPrecision":{"provisional":false,"inDomainHitRate":0.0,"outDomainFalsePositiveRate":0.0,"precision":0.0,"pass":false,"misclassified":[],"notes":""},"K4_noDuplication":{"score":0,"pass":false,"evidence":""},"K7_imperativeStyle":{"ratio":0.0,"pass":false,"notes":""},"K8_sourceCitation":{"ratio":0.0,"pass":false,"sampledFiles":[],"notes":""},"K9_noTimeSensitive":{"pass":false,"findings":[]}}