Tynner duplisert/volatil body-info i de to skills som feilet begge kriterier, til pekere mot kanoniske ref-filer. Fersk operatør-gated LLM-judge: security K4 5/5 + K9 PASS; governance K4 5/5 + K9 PASS. Security (K9): Defender GA/preview/Azure-Gov-status, §3-ytelsestall, GPT-4o-par og PTU break-even ut av body. Uverifiserte tall (20-50ms, 5-10x, 80% latens — fantes i ingen ref) droppet, ikke flyttet. Security (K4): risikoklassifiserings-tabellen (divergerte fra rubrikk: 6 band vs 5, manglet Uakseptabel) + P10/P50/P90-tabellen (flat x0.6/x1.8 motsa kanonisk per-komponent-modell, agentens OBLIGATORISK-kilde) -> peker. Antakelse-test bestaatt: ingenting asserter body-tallene. Governance (K9): EU Data Boundary §2.3 - droppet volatile regioner (Sweden Central/West Europe; body motsa refs som sier Norway East/West Europe), repek kryss-ref til gdpr-compliance-ai-systems.md. Governance (K4): §6.2 AI Act-tre - kollapset oppramsede (og ufullstendige) Art.5 + Annex III-lister til pekere mot ai-act-classification-methodology.md; §2.1 eneste oversiktstabell. judge-prompt.md K9 strammet: stabile identifikatorer (forordningsaar, OWASP 2025, MADR v3.0, saksnr) eksplisitt ute av scope. judge-results.json oppdatert med ferske sec+gov-verdikter. Gates: validate 239 · kb-eval 15 · kb-update 122 · kb-integrity 192/192. Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01REiKFhP4w6xGXXqWKpPCJJ
2.5 KiB
LLM-judge-rubrikk (K1/K4/K7/K8/K9) — skill-kvalitet, ms-ai-architect
Pinnet rubrikk for de semantiske eval-kriteriene som ikke kan måles deterministisk.
Kjøres som operatør-gated subagent-steg (Opus, én dommer per skill). De deterministiske
kriteriene (K2/K3/K5/K6 + ref-tall) måles av eval.mjs; denne dekker resten.
Placeholders: <NAME> = skill-navn, <ROOT> = plugin-rot, <PATH> = sti til SKILL.md.
Du er en skill-kvalitets-dommer (LLM-as-judge) for ms-ai-architect. Vurder skillen
<NAME> mot K1/K4/K7/K8/K9. Plugin-rot: <ROOT>. SKILL.md: <PATH>. Referansefiler:
<ROOT>/skills/<NAME>/references/.
Les SKILL.md i sin helhet. For K8: sample 5 tilfeldige referansefiler og les headeren deres. Vær streng og adversariell — ikke ros, ikke pynt på tall.
- K1 trigger-presisjon [PROVISIONAL]: generer 10 in-domain + 10 out-of-domain prompts for
domenet. For hver, avgjør KUN fra
description-feltet om skillen burde trigge. Rapporter provisional precision (korrekte/20). FLAGG eksplisitt at operatør må kuratere de endelige 20. - K4 ingen duplisering (SKILL.md ↔ ref-filer): score 1–5 (5 = ingen duplisering). Finnes detalj i SKILL.md body som dupliserer ref-filer? Gi konkret eksempel. pass = score ≥ 4.
- K7 imperativ/instruksjons-stil: sample 10 instruksjonssetninger fra body; andel i imperativ/infinitiv. pass = ratio ≥ 0.80.
- K8 kildehenvisning i ref-filer: for 5 samplede ref-filer, har header
Last updated/Verified/ kilde-URL? Rapporter andel. pass = ratio ≥ 0.80. - K9 ingen VOLATIL tid-sensitiv info i SKILL.md body: finnes volatile påstander DIREKTE i body (ikke i ref-filer) — GA/preview-release-status, modellversjoner, SLA-/ytelses-/pris-tall, regions- tilgjengelighet? List funn. pass = ingen volatile funn. Utenfor scope (ikke funn): stabile identifikatorer som forordningsår (2024/1689), lovsaksnr (C-311/18), standard-versjonsnavn (OWASP LLM Top 10 2025, MADR v3.0), filnavn og generisk forklarende «preview»/«GA» uten konkret produkt-status. Disse er navngitte identifikatorer, ikke ferskhets-sensitive påstander.
RETURNER KUN dette JSON-objektet (ingen annen tekst, ingen markdown-fence):
{"skill":"<NAME>","K1_triggerPrecision":{"provisional":true,"precision":0.0,"notes":""},"K4_noDuplication":{"score":0,"pass":false,"evidence":""},"K7_imperativeStyle":{"ratio":0.0,"pass":false,"notes":""},"K8_sourceCitation":{"ratio":0.0,"pass":false,"sampledFiles":[],"notes":""},"K9_noTimeSensitive":{"pass":false,"findings":[]}}