chore(ms-ai-architect): refresh KB high-bucket — 49 files [skip-docs]

KB-currency refresh (high priority, 2026-06-19) via /architect:kb-update.
49 high-prioritets governance/security/monitoring-filer re-verifisert mot
Microsoft Learn (MCP) — delegert til 8 parallelle Opus-subagenter gruppert
etter delt kilde, verifisert i hovedkontekst (diff-review + tester).

Hovedendringer (faktuelle korreksjoner + currency):
- MITRE ATLAS-IDer korrigert (supply-chain): AML.T0050 -> AML.T0018.000
  (Poison AI Model); AML.T0020 = Poison Training Data; T1195 Supply Chain
  Compromise. Gamle IDer var utdaterte (verifisert mot MCSB v2 AI-1).
- OTel-sampling presisert (distributed-tracing): adaptive sampling = klassisk
  App Insights SDK; OTel-distroen sampler IKKE by default (fixed-rate/
  rate-limited maa konfigureres); Functions parent-based sampling er default.
- MCSB v2 AI-kontroller AI-1 -> AI-7 (risk-taxonomy three-pillar, scoring-
  framework, rubrics, red-team, adversarial); Defender for Cloud AI threat
  protection + AI-SPM (GA).
- AI gateway (APIM) multi-provider: Anthropic Messages API v2-tiers, Google
  Vertex, unified model API (preview), MCP/A2A, Foundry-integrasjon; eksakte
  policy-navn (llm-emit-token-metric maks 5 dims, llm-semantic-cache-*,
  score-threshold = avstand, MS-eks. 0.15).
- Purview Enterprise AI apps inkl. Anthropic Claude (Enterprise) + ChatGPT
  Enterprise; Security Dashboard for AI (Agent 365-inventar, MCP-servere,
  tredjepartsmodeller; Security Reader minimumsrolle).
- Entra Agent ID: CA-lisenskrav (Entra ID P1/P2 + Agent 365), CA-scoping per
  tilgangsmoenster (on-behalf-of/app-only/agent-as-user), CA-grenser,
  connector-permissions som API-permissions.
- Copilot DLP: Block SITs in web search (GA, Performing Web Searches) + Block
  external email (preview) som prompt injection-vern.
- Azure AI Language PII: tre feature-typer, GA-API 2026-05-01; NOIdentityNumber
  bekreftet dedikert kategori for norske foedselsnummer.
- Foundry Tools-rename forsterket paa tvers; alle 49 Last updated -> 2026-06-19.

Discovery: 500 kandidater (alle Databricks-stoey) -> kun registry-kandidater,
ingen nye skills/-filer -> 389-telling uendret. validate 239 PASS,
kb-integrity 115/115 (262 orphan-warnings uendret), gitleaks clean.

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01REiKFhP4w6xGXXqWKpPCJJ
This commit is contained in:
Kjell Tore Guttormsen 2026-06-19 11:09:54 +02:00
commit 25bcb74d9a
49 changed files with 304 additions and 235 deletions

View file

@ -1,6 +1,6 @@
# PII Detection and Masking in Norwegian Text
**Last updated:** 2026-05
**Last updated:** 2026-06-19
**Status:** GA
**Category:** AI Security Engineering
@ -23,13 +23,13 @@ Azure AI Language støtter norsk språk (`language: "no"`) og kan detektere båd
### Azure AI Language PII Detection
Azure AI Language tilbyr tre API-varianter for PII-deteksjon:
Azure AI Language grupperer PII i tre feature-typer (etter input-format og prosesseringsmodell):
| Variant | Bruksområde | Format |
| Feature-type | Bruksområde | Format |
|---------|-------------|--------|
| **Text PII** | Ustrukturert tekst (e-post, chat, notater) | JSON payload |
| **Conversation PII** | Transkribert tale fra møter og kundesenter | Strukturert conversation format |
| **Native Document PII** | PDF, DOCX, TXT-filer | Asynkron batch-prosessering |
| **Text PII** | Ustrukturert tekst (e-post, chat, notater, prompts, logger) | Synkron, string-basert JSON payload |
| **Conversation PII** | Transkribert tale fra møter og kundesenter | Asynkron, tur-/transkriptbasert format |
| **Document-based PII** (tidl. «Native Document PII») | `.pdf`, `.docx`, `.txt`-filer | Asynkron, lagringsbasert; bevarer dokumentstruktur + JSON-metadata |
### Støttede entitetstyper (norsk kontekst)
@ -48,9 +48,11 @@ Azure AI Language tilbyr tre API-varianter for PII-deteksjon:
**Viktig:** Azure detekterer norske fødselsnummer under kategorien `NOIdentityNumber`. Du må spesifisere `language: "no"` for optimal deteksjon.
### Maskeringsstrategier *(Verified MCP 2026-04)*
### Maskeringsstrategier *(Verified MCP 2026-06)*
Azure AI Language tilbyr fire redaction policies (2025-11-15-preview):
> **API-versjoner (Text PII):** GA er **`2026-05-01`**; nyeste preview er **`2026-05-15-preview`**. Redaction-policies, `confidenceScoreThreshold`, `disableEntityValidation`, `entitySynonyms` og `valueExclusionPolicy` er preview-funksjoner (først introdusert i `2025-11-15-preview`, nå dokumentert under gjeldende preview). Bruk GA-versjonen for produksjon.
Azure AI Language tilbyr fire redaction policies (`redactionPolicies`):
| Policy | Output | Bruksområde |
|--------|--------|-------------|
@ -61,15 +63,15 @@ Azure AI Language tilbyr fire redaction policies (2025-11-15-preview):
**Anbefalt:** `CharacterMask` for produksjon, `EntityMask` for logging (spesifiserer entitetstype), `NoMask` når du kun trenger deteksjon uten redaction.
**Ny: Per-entity policy overrides:** Du kan nå spesifisere ulike policies per entitetstype i samme request, med én `defaultRedactionPolicy` og entitetsspesifikke overrides. *(Verified MCP 2026-04)*
**Per-entity policy overrides:** Du kan spesifisere ulike policies per entitetstype i samme request, med én `defaultRedactionPolicy` og entitetsspesifikke overrides. *(Verified MCP 2026-06)*
**Ny: DisableEntityValidation** (2025-11-15-preview): Mulighet til å deaktivere streng entitetsvalidering (default `false`) for å øke hastighet i scenarioer der validering ikke er nødvendig. *(Verified MCP 2026-04)*
**DisableEntityValidation:** Mulighet til å deaktivere streng entitetsvalidering (default `false`) for å øke hastighet i scenarioer der validering ikke er nødvendig. *(Verified MCP 2026-06)*
**Ny: EntitySynonyms og ValueExclusionPolicy:** Tilpass PII-tjenesten til organisasjonens vokabular — definer egne synonymer for entitetstyper, og ekskluder spesifikke termer fra deteksjon (f.eks. "politimann", "vitne"). *(Verified MCP 2026-04)*
**EntitySynonyms og ValueExclusionPolicy:** Tilpass PII-tjenesten til organisasjonens vokabular — definer egne synonymer for entitetstyper, og ekskluder spesifikke termer fra deteksjon (f.eks. "politimann", "vitne"). *(Verified MCP 2026-06)*
### Confidence Threshold *(Verified MCP 2026-04)*
### Confidence Threshold *(Verified MCP 2026-06)*
Fra 2025-11-15-preview kan du konfigurere `confidenceScoreThreshold` med global default og per-entitet, per-språk overrides:
Med preview-API-et kan du konfigurere `confidenceScoreThreshold` med global default og per-entitet, per-språk overrides:
```json
{
@ -191,9 +193,9 @@ Original data → Azure AI Language PII → Pseudonymisering → Sekundær datab
4. Lim inn tekst med fødselsnummer
5. Se detekterte entiteter med confidence scores
**Model deployment:** Bruk `modelVersion: "latest"` for GA-modellen, `"2025-11-15-preview"` for nye preview-features.
**Model deployment:** Bruk `modelVersion: "latest"` for nyeste modell; velg GA-API `2026-05-01` for produksjon og `2026-05-15-preview` for nye preview-features.
**Merk:** Microsoft Foundry (new) — ny portal med Foundry-prosjekter — og Foundry (classic) er begge tilgjengelige via `https://ai.azure.com/`. For opprettelse av Language-ressurs, bruk **Azure Language in Foundry Tools**. *(Verified MCP 2026-04)*
**Merk:** Microsoft Foundry (new) — ny portal med Foundry-prosjekter — og Foundry (classic) er begge tilgjengelige via `https://ai.azure.com/`. For opprettelse av Language-ressurs, bruk **Azure Language in Foundry Tools**. *(Verified MCP 2026-06)*
### Copilot Studio
@ -414,10 +416,10 @@ df_masked = df.withColumn("text_masked", mask_pii_udf(df.text))
## Kilder og verifisering
**Verified (fra Microsoft Learn MCP, re-verifisert 2026-04):** *(Verified MCP 2026-04)*
- [Azure AI Language PII Detection Overview](https://learn.microsoft.com/en-us/azure/ai-services/language-service/personally-identifiable-information/overview) — Oppdatert: bruker nå «Azure Language in Foundry Tools»-terminologi; ny Foundry (new) portal
- [Recognized PII and PHI Entities](https://learn.microsoft.com/en-us/azure/ai-services/language-service/personally-identifiable-information/concepts/entity-categories) (inkluderer NOIdentityNumber)
- [How to: Redact Text PII](https://learn.microsoft.com/en-us/azure/ai-services/language-service/personally-identifiable-information/how-to/redact-text-pii) — Oppdatert: ny DisableEntityValidation, EntitySynonyms, ValueExclusionPolicy, per-entity confidence threshold overrides (2025-11-15-preview)
**Verified (fra Microsoft Learn MCP, re-verifisert 2026-06):** *(Verified MCP 2026-06)*
- [Azure AI Language PII Detection Overview](https://learn.microsoft.com/en-us/azure/ai-services/language-service/personally-identifiable-information/overview) — Oppdatert: tre feature-typer (Text PII / Conversation PII / **Document-based PII**); bruker «Azure Language in Foundry Tools»-terminologi; Foundry (new) + (classic)
- [Recognized PII and PHI Entities](https://learn.microsoft.com/en-us/azure/ai-services/language-service/personally-identifiable-information/concepts/entity-categories) — bekrefter dedikert kategori **NOIdentityNumber** («Norway Identity Number»)
- [How to: Redact Text PII](https://learn.microsoft.com/en-us/azure/ai-services/language-service/personally-identifiable-information/how-to/redact-text-pii) — Text PII GA-API **`2026-05-01`**, preview **`2026-05-15-preview`**; redactionPolicies (4 typer), confidenceScoreThreshold-overrides, DisableEntityValidation, EntitySynonyms, ValueExclusionPolicy
- [Quickstart: Detect PII](https://learn.microsoft.com/en-us/azure/ai-services/language-service/personally-identifiable-information/quickstart) — Quickstart er nå for native document PII; link til text/conversation how-to-guides for tekst-PII
- [Transparency Note for PII](https://learn.microsoft.com/en-us/azure/foundry/responsible-ai/language-service/transparency-note-personally-identifiable-information) (GDPR compliance, nå under Azure AI Foundry responsible AI)
@ -427,4 +429,4 @@ df_masked = df.withColumn("text_masked", mask_pii_udf(df.text))
- Personopplysningsloven (norsk GDPR-implementering)
- Datatilsynets veiledning om pseudonymisering
**Konfidensnivå:** 95% (Verified via Microsoft Learn MCP 2026-04, Baseline fra kjente standarder)
**Konfidensnivå:** 95% (Verified via Microsoft Learn MCP 2026-06, Baseline fra kjente standarder)