(a) 2 description-fikser (operatør-godkjent): - governance: +Schrems II/TIA-trigger (recall-gap 0.85→1.0; governance eier domenet — 20 ref-filer + data-residency-audit-monitoring.md) - advisor: strammere — selection-forankret + eksplisitt negativ scope (NOT for build/secure/operate/legally-assess); fjernet bred "Microsoft AI architecture"-trigger som kolliderte med søsken (b) Kuratert testsett + mekanikk: - ny data/k1-trigger-prompts.json (100 prompts: 10 in + 10 adversarielt out/skill) - judge-prompt.md K1: generer→konsumer kuratert sett + nytt skjema (inDomainHitRate/outDomainFalsePositiveRate/pass/misclassified, provisional=false) - blindet måling: 5 Opus-dommere ser kun description + 20 stokkede umerkede prompts; ground-truth scoret deterministisk utenfor dommeren Resultat: K1 PASS alle 5 — hit 1.0 / fp 0.0 / presisjon 1.0 / 0 miss. Begge fikser validert i dommer-begrunnelsene. K2 fortsatt PASS. Ikke regredert: validate 239 · kb-eval 15 · kb-update 122 · kb-integrity 192/192. Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01REiKFhP4w6xGXXqWKpPCJJ
44 lines
3.1 KiB
Markdown
44 lines
3.1 KiB
Markdown
# LLM-judge-rubrikk (K1/K4/K7/K8/K9) — skill-kvalitet, ms-ai-architect
|
||
|
||
Pinnet rubrikk for de semantiske eval-kriteriene som ikke kan måles deterministisk.
|
||
Kjøres som operatør-gated subagent-steg (Opus, én dommer per skill). De deterministiske
|
||
kriteriene (K2/K3/K5/K6 + ref-tall) måles av `eval.mjs`; denne dekker resten.
|
||
|
||
Placeholders: `<NAME>` = skill-navn, `<ROOT>` = plugin-rot, `<PATH>` = sti til SKILL.md.
|
||
|
||
---
|
||
|
||
Du er en skill-kvalitets-dommer (LLM-as-judge) for ms-ai-architect. Vurder skillen
|
||
`<NAME>` mot K1/K4/K7/K8/K9. Plugin-rot: `<ROOT>`. SKILL.md: `<PATH>`. Referansefiler:
|
||
`<ROOT>/skills/<NAME>/references/`.
|
||
|
||
Les SKILL.md i sin helhet. For K8: sample 5 tilfeldige referansefiler og les headeren deres.
|
||
Vær streng og adversariell — ikke ros, ikke pynt på tall.
|
||
|
||
- **K1 trigger-presisjon:** last det operatør-kuraterte settet for `<NAME>` fra
|
||
`<ROOT>/scripts/kb-eval/data/k1-trigger-prompts.json` (nøkkel `<NAME>`: `in_domain` [10] +
|
||
`out_of_domain` [10]). IKKE generer egne prompts. For HVER prompt, avgjør KUN fra `description`-feltet
|
||
i `<PATH>` om skillen burde trigge (ignorer body, ref-filer og intent). Scoring: en `in_domain`-prompt
|
||
er en TREFF hvis den trigger; en `out_of_domain`-prompt er en FALSK POSITIV hvis den trigger. Rapporter
|
||
`inDomainHitRate` (treff/10), `outDomainFalsePositiveRate` (falske positive/10), samlet `precision`
|
||
(korrekte/20) og `misclassified` (list de feilklassifiserte promptene + hvorfor). Settet er
|
||
operatør-kuratert → sett `provisional=false`. pass = `inDomainHitRate ≥ 0.90` OG
|
||
`outDomainFalsePositiveRate ≤ 0.10`.
|
||
- **K4 ingen duplisering (SKILL.md ↔ ref-filer):** score 1–5 (5 = ingen duplisering). Finnes detalj
|
||
i SKILL.md body som dupliserer ref-filer? Gi konkret eksempel. pass = score ≥ 4.
|
||
- **K7 imperativ/instruksjons-stil:** sample 10 instruksjonssetninger fra body; andel i
|
||
imperativ/infinitiv. pass = ratio ≥ 0.80.
|
||
- **K8 kildehenvisning i ref-filer:** for 5 samplede ref-filer, har header `Last updated` /
|
||
`Verified` / kilde-URL? Rapporter andel. pass = ratio ≥ 0.80.
|
||
- **K9 ingen VOLATIL tid-sensitiv info i SKILL.md body:** finnes **volatile** påstander DIREKTE i body
|
||
(ikke i ref-filer) — GA/preview-release-status, modellversjoner, SLA-/ytelses-/pris-tall, regions-
|
||
tilgjengelighet? List funn. pass = ingen volatile funn. **Utenfor scope (ikke funn):** stabile
|
||
identifikatorer som forordningsår (2024/1689), lovsaksnr (C-311/18), standard-versjonsnavn
|
||
(OWASP LLM Top 10 2025, MADR v3.0), filnavn og generisk forklarende «preview»/«GA» uten konkret
|
||
produkt-status. Disse er navngitte identifikatorer, ikke ferskhets-sensitive påstander.
|
||
|
||
RETURNER KUN dette JSON-objektet (ingen annen tekst, ingen markdown-fence):
|
||
|
||
```
|
||
{"skill":"<NAME>","K1_triggerPrecision":{"provisional":false,"inDomainHitRate":0.0,"outDomainFalsePositiveRate":0.0,"precision":0.0,"pass":false,"misclassified":[],"notes":""},"K4_noDuplication":{"score":0,"pass":false,"evidence":""},"K7_imperativeStyle":{"ratio":0.0,"pass":false,"notes":""},"K8_sourceCitation":{"ratio":0.0,"pass":false,"sampledFiles":[],"notes":""},"K9_noTimeSensitive":{"pass":false,"findings":[]}}
|
||
```
|