refactor(ms-ai-architect): R14 — persona ut av plugin-flaten, og de seks stedene som produserte den
Nøytral arkitekt-ramme (ratifisert 15.09) i SKILL.md-ene, 23 kommandoer, 70 redaksjonelle forekomster i ref-korpuset, README/CLAUDE.md/NOTICE og A11Y-rapportens proveniens-linje. Hver av de 70 avgjort i kontekst: dialog fikk ny taler, proveniens ny opphavspåstand. Ordren navnga fem produsent-steder; den live sjette manglet. `PROMPT_TEMPLATE` settes i generate-skills.sh:27 og leses ALDRI — prompten er en heredoc i samme script. Å rette bare prompt-template.md ville latt generatoren re-minte personaen ved neste KB-kjøring. Ny G4-klausul i check-cosmo-gate.mjs: persona i leveranseflaten = 0, derivasjonsregisteret pinnet per fil PÅ TALL (et filnavn-unntak er blindt for hva fila senere inneholder). Registeret utvidet med README.md 3 — versjonstabellens rader er historikk, ikke leveranse. Den ene genitiv-formede produktlinja adjudiseres på cosmos-db-URL-en i samme rad; regelen er målt lukket (8 tvetydige linjer totalt, 33 URL-linjer, 2 persona-klassifiserte, begge produkt) og hvitvasker ikke bar `Cosmo`. classifyCosmo urørt — baselinene hviler på den. R3 godtar nå R14-utført (0) men ingenting imellom: et halvveis sveip felles fortsatt. Bevis: gate PASSED + NETTET VALIDERT BEGGE VEIER · 1137/1137 · validate-plugin 250/0/0 · begge --dry-drivere 0 · Layer B 45/45 OK (kjent-positiv feller, exit 1). Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
parent
1c9af82daa
commit
ced0c5f46d
80 changed files with 400 additions and 152 deletions
|
|
@ -609,7 +609,7 @@ Pricing not publicly disclosed — contact Microsoft for quote
|
|||
|
||||
**Steg 1: Kartlegg risiko**
|
||||
|
||||
*Cosmo:* "La oss starte med å forstå risikoprofilen. Hvilken type AI-system planlegger dere?
|
||||
*Arkitekten:* "La oss starte med å forstå risikoprofilen. Hvilken type AI-system planlegger dere?
|
||||
- User-facing chatbot?
|
||||
- Internal copilot?
|
||||
- AI agent med tool access?
|
||||
|
|
@ -617,7 +617,7 @@ Pricing not publicly disclosed — contact Microsoft for quote
|
|||
|
||||
**Steg 2: Identifiser angrepsflater**
|
||||
|
||||
*Cosmo:* "Based på beskrivelsen, ser jeg følgende angrepsflater:
|
||||
*Arkitekten:* "Based på beskrivelsen, ser jeg følgende angrepsflater:
|
||||
- **User prompts:** Direkte jailbreak-forsøk fra brukere
|
||||
- **Documents:** Indirect prompt injection via eksterne dokumenter
|
||||
- **Tool outputs:** XPIA via agent tool calls
|
||||
|
|
@ -626,7 +626,7 @@ Jeg anbefaler følgende defense-in-depth arkitektur: [vis Pattern 1 diagram]"
|
|||
|
||||
**Steg 3: Velg security controls**
|
||||
|
||||
*Cosmo:* "For deres use case anbefaler jeg:
|
||||
*Arkitekten:* "For deres use case anbefaler jeg:
|
||||
|
||||
**Tier 1 (Must-have):**
|
||||
- Prompt Shields (user + document attacks)
|
||||
|
|
@ -646,7 +646,7 @@ Estimert kostnad: ~8,700 NOK/måned. Er dette innenfor budsjettet?"
|
|||
|
||||
**Steg 4: Design red teaming strategy**
|
||||
|
||||
*Cosmo:* "For continuous security validation, anbefaler jeg:
|
||||
*Arkitekten:* "For continuous security validation, anbefaler jeg:
|
||||
|
||||
**Pre-deployment:**
|
||||
- Run Azure AI Red Teaming Agent med 100+ attacks
|
||||
|
|
@ -693,25 +693,25 @@ Kan jeg hjelpe med å sette opp CI/CD integration?"
|
|||
|
||||
*Problem:* "Vi setter opp content filters på output, det holder vel?"
|
||||
|
||||
*Cosmo:* "Nei — det er for sent. Hvis en prompt injector får modellen til å generere ondsinnede tool calls, er skaden skjedd før output filtering. Bruk defense-in-depth: Prompt Shields på input + safety meta-prompts + output filters."
|
||||
*Arkitekten:* "Nei — det er for sent. Hvis en prompt injector får modellen til å generere ondsinnede tool calls, er skaden skjedd før output filtering. Bruk defense-in-depth: Prompt Shields på input + safety meta-prompts + output filters."
|
||||
|
||||
**Pitfall 2: One-time testing**
|
||||
|
||||
*Problem:* "Vi kjørte red teaming før launch, trenger ikke mer testing?"
|
||||
|
||||
*Cosmo:* "Models og attack vectors evolves. En gang-testing gir false sense of security. Implementer continuous red teaming (monthly) + real-time monitoring. DORA krever også periodic resilience testing."
|
||||
*Arkitekten:* "Models og attack vectors evolves. En gang-testing gir false sense of security. Implementer continuous red teaming (monthly) + real-time monitoring. DORA krever også periodic resilience testing."
|
||||
|
||||
**Pitfall 3: Ignorer indirect attacks (XPIA)**
|
||||
|
||||
*Problem:* "RAG system med eksterne docs — kun testet user prompts?"
|
||||
|
||||
*Cosmo:* "Kritisk gap! Indirect prompt injection via documents er en stor risikoflate. Attackers kan embedde hidden instructions i PDFs, emails, websites. Enable Prompt Shields for Documents + test med Azure AI Red Teaming Agent's XPIA scenarios."
|
||||
*Arkitekten:* "Kritisk gap! Indirect prompt injection via documents er en stor risikoflate. Attackers kan embedde hidden instructions i PDFs, emails, websites. Enable Prompt Shields for Documents + test med Azure AI Red Teaming Agent's XPIA scenarios."
|
||||
|
||||
**Pitfall 4: Over-reliance på ASR metric**
|
||||
|
||||
*Problem:* "ASR = 2%, vi er sikre?"
|
||||
|
||||
*Cosmo:* "ASR er en proxy metric, ikke garanti. Den dekker kjente attack patterns, ikke zero-days. Supplement med:
|
||||
*Arkitekten:* "ASR er en proxy metric, ikke garanti. Den dekker kjente attack patterns, ikke zero-days. Supplement med:
|
||||
- Manual red teaming (creative attacks)
|
||||
- Domain-specific risk scenarios
|
||||
- Real-world monitoring (Defender for AI)
|
||||
|
|
|
|||
Loading…
Add table
Add a link
Reference in a new issue