(a) 2 description-fikser (operatør-godkjent): - governance: +Schrems II/TIA-trigger (recall-gap 0.85→1.0; governance eier domenet — 20 ref-filer + data-residency-audit-monitoring.md) - advisor: strammere — selection-forankret + eksplisitt negativ scope (NOT for build/secure/operate/legally-assess); fjernet bred "Microsoft AI architecture"-trigger som kolliderte med søsken (b) Kuratert testsett + mekanikk: - ny data/k1-trigger-prompts.json (100 prompts: 10 in + 10 adversarielt out/skill) - judge-prompt.md K1: generer→konsumer kuratert sett + nytt skjema (inDomainHitRate/outDomainFalsePositiveRate/pass/misclassified, provisional=false) - blindet måling: 5 Opus-dommere ser kun description + 20 stokkede umerkede prompts; ground-truth scoret deterministisk utenfor dommeren Resultat: K1 PASS alle 5 — hit 1.0 / fp 0.0 / presisjon 1.0 / 0 miss. Begge fikser validert i dommer-begrunnelsene. K2 fortsatt PASS. Ikke regredert: validate 239 · kb-eval 15 · kb-update 122 · kb-integrity 192/192. Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01REiKFhP4w6xGXXqWKpPCJJ
3.1 KiB
LLM-judge-rubrikk (K1/K4/K7/K8/K9) — skill-kvalitet, ms-ai-architect
Pinnet rubrikk for de semantiske eval-kriteriene som ikke kan måles deterministisk.
Kjøres som operatør-gated subagent-steg (Opus, én dommer per skill). De deterministiske
kriteriene (K2/K3/K5/K6 + ref-tall) måles av eval.mjs; denne dekker resten.
Placeholders: <NAME> = skill-navn, <ROOT> = plugin-rot, <PATH> = sti til SKILL.md.
Du er en skill-kvalitets-dommer (LLM-as-judge) for ms-ai-architect. Vurder skillen
<NAME> mot K1/K4/K7/K8/K9. Plugin-rot: <ROOT>. SKILL.md: <PATH>. Referansefiler:
<ROOT>/skills/<NAME>/references/.
Les SKILL.md i sin helhet. For K8: sample 5 tilfeldige referansefiler og les headeren deres. Vær streng og adversariell — ikke ros, ikke pynt på tall.
- K1 trigger-presisjon: last det operatør-kuraterte settet for
<NAME>fra<ROOT>/scripts/kb-eval/data/k1-trigger-prompts.json(nøkkel<NAME>:in_domain[10] +out_of_domain[10]). IKKE generer egne prompts. For HVER prompt, avgjør KUN fradescription-feltet i<PATH>om skillen burde trigge (ignorer body, ref-filer og intent). Scoring: enin_domain-prompt er en TREFF hvis den trigger; enout_of_domain-prompt er en FALSK POSITIV hvis den trigger. RapporterinDomainHitRate(treff/10),outDomainFalsePositiveRate(falske positive/10), samletprecision(korrekte/20) ogmisclassified(list de feilklassifiserte promptene + hvorfor). Settet er operatør-kuratert → settprovisional=false. pass =inDomainHitRate ≥ 0.90OGoutDomainFalsePositiveRate ≤ 0.10. - K4 ingen duplisering (SKILL.md ↔ ref-filer): score 1–5 (5 = ingen duplisering). Finnes detalj i SKILL.md body som dupliserer ref-filer? Gi konkret eksempel. pass = score ≥ 4.
- K7 imperativ/instruksjons-stil: sample 10 instruksjonssetninger fra body; andel i imperativ/infinitiv. pass = ratio ≥ 0.80.
- K8 kildehenvisning i ref-filer: for 5 samplede ref-filer, har header
Last updated/Verified/ kilde-URL? Rapporter andel. pass = ratio ≥ 0.80. - K9 ingen VOLATIL tid-sensitiv info i SKILL.md body: finnes volatile påstander DIREKTE i body (ikke i ref-filer) — GA/preview-release-status, modellversjoner, SLA-/ytelses-/pris-tall, regions- tilgjengelighet? List funn. pass = ingen volatile funn. Utenfor scope (ikke funn): stabile identifikatorer som forordningsår (2024/1689), lovsaksnr (C-311/18), standard-versjonsnavn (OWASP LLM Top 10 2025, MADR v3.0), filnavn og generisk forklarende «preview»/«GA» uten konkret produkt-status. Disse er navngitte identifikatorer, ikke ferskhets-sensitive påstander.
RETURNER KUN dette JSON-objektet (ingen annen tekst, ingen markdown-fence):
{"skill":"<NAME>","K1_triggerPrecision":{"provisional":false,"inDomainHitRate":0.0,"outDomainFalsePositiveRate":0.0,"precision":0.0,"pass":false,"misclassified":[],"notes":""},"K4_noDuplication":{"score":0,"pass":false,"evidence":""},"K7_imperativeStyle":{"ratio":0.0,"pass":false,"notes":""},"K8_sourceCitation":{"ratio":0.0,"pass":false,"sampledFiles":[],"notes":""},"K9_noTimeSensitive":{"pass":false,"findings":[]}}