feat(ms-ai-architect): Sesjon 1 - skill eval-baseline (rubrikk K1-K9) + ai-foundry probe
Read-only eval-verktoy scripts/kb-eval/eval.mjs (determ. K2/K3/K5/K6 + ref-tall) + operator-gated LLM-judge (judge-prompt.md -> data/judge-results.json) flettet til data/eval-baseline.json. 13 enhetstester (tests/kb-eval/), 42 kb-update-tester gronne. Baseline: K5 3/5 fail, K9 4/5 fail, K4 2/5 fail, ref-tall 2/5 fail; 2 konkrete bugs flagget (security 6x5-vekting-motstrid, governance broken ref-path). Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01REiKFhP4w6xGXXqWKpPCJJ
This commit is contained in:
parent
bae0977292
commit
215772df87
5 changed files with 936 additions and 0 deletions
34
scripts/kb-eval/judge-prompt.md
Normal file
34
scripts/kb-eval/judge-prompt.md
Normal file
|
|
@ -0,0 +1,34 @@
|
|||
# LLM-judge-rubrikk (K1/K4/K7/K8/K9) — skill-kvalitet, ms-ai-architect
|
||||
|
||||
Pinnet rubrikk for de semantiske eval-kriteriene som ikke kan måles deterministisk.
|
||||
Kjøres som operatør-gated subagent-steg (Opus, én dommer per skill). De deterministiske
|
||||
kriteriene (K2/K3/K5/K6 + ref-tall) måles av `eval.mjs`; denne dekker resten.
|
||||
|
||||
Placeholders: `<NAME>` = skill-navn, `<ROOT>` = plugin-rot, `<PATH>` = sti til SKILL.md.
|
||||
|
||||
---
|
||||
|
||||
Du er en skill-kvalitets-dommer (LLM-as-judge) for ms-ai-architect. Vurder skillen
|
||||
`<NAME>` mot K1/K4/K7/K8/K9. Plugin-rot: `<ROOT>`. SKILL.md: `<PATH>`. Referansefiler:
|
||||
`<ROOT>/skills/<NAME>/references/`.
|
||||
|
||||
Les SKILL.md i sin helhet. For K8: sample 5 tilfeldige referansefiler og les headeren deres.
|
||||
Vær streng og adversariell — ikke ros, ikke pynt på tall.
|
||||
|
||||
- **K1 trigger-presisjon [PROVISIONAL]:** generer 10 in-domain + 10 out-of-domain prompts for
|
||||
domenet. For hver, avgjør KUN fra `description`-feltet om skillen burde trigge. Rapporter
|
||||
provisional precision (korrekte/20). FLAGG eksplisitt at operatør må kuratere de endelige 20.
|
||||
- **K4 ingen duplisering (SKILL.md ↔ ref-filer):** score 1–5 (5 = ingen duplisering). Finnes detalj
|
||||
i SKILL.md body som dupliserer ref-filer? Gi konkret eksempel. pass = score ≥ 4.
|
||||
- **K7 imperativ/instruksjons-stil:** sample 10 instruksjonssetninger fra body; andel i
|
||||
imperativ/infinitiv. pass = ratio ≥ 0.80.
|
||||
- **K8 kildehenvisning i ref-filer:** for 5 samplede ref-filer, har header `Last updated` /
|
||||
`Verified` / kilde-URL? Rapporter andel. pass = ratio ≥ 0.80.
|
||||
- **K9 ingen tid-sensitiv info i SKILL.md body:** finnes datoer/versjoner/GA/preview-status DIREKTE
|
||||
i body (ikke i ref-filer)? List funn. pass = ingen funn.
|
||||
|
||||
RETURNER KUN dette JSON-objektet (ingen annen tekst, ingen markdown-fence):
|
||||
|
||||
```
|
||||
{"skill":"<NAME>","K1_triggerPrecision":{"provisional":true,"precision":0.0,"notes":""},"K4_noDuplication":{"score":0,"pass":false,"evidence":""},"K7_imperativeStyle":{"ratio":0.0,"pass":false,"notes":""},"K8_sourceCitation":{"ratio":0.0,"pass":false,"sampledFiles":[],"notes":""},"K9_noTimeSensitive":{"pass":false,"findings":[]}}
|
||||
```
|
||||
Loading…
Add table
Add a link
Reference in a new issue