chore(ms-ai-architect): refresh KB critical-bucket — 15 files [skip-docs]

KB-currency refresh (critical priority, 2026-06-19) via /architect:kb-update.
15 critical cost/arkitektur-filer re-verifisert mot Microsoft Learn (MCP).

Hovedendringer:
- Azure AI Search Serverless (Preview) prismodell (rag-cost, rag-query,
  vector-storage, rag-enterprise-scale)
- Agentic retrieval GA-split (2026-04-01 REST GA, portal preview) + Foundry IQ
- AI gateway multi-provider (Anthropic v2 / Google Vertex), unified model API
  (preview), Foundry-integrasjon (enterprise-arch, ai-services-cost,
  multi-model, cost-tracking)
- FOCUS-skjema + Cost Mgmt -> ADLS Gen2 -> Fabric -> Power BI pipeline
  (cost-management, cost-allocation)
- FinOps hub AI-agent via Azure MCP / Copilot Studio (budget-forecasting)
- OTel trace-based sampling for logs (observability)
- Korreksjoner: semantic-cache score-threshold = AVSTAND (0.15, ikke 0.85
  cosine-likhet); llm-emit-token-metric maks 5 custom dimensions;
  Foundry RBAC-renames (Owner/Contributor = kun mgmt); Researcher/Analyst er
  ikke agenter
- Alle 15 Last updated -> 2026-06-19

High-bucket (49 filer) UTSATT til egen sesjon (operatoer-valg).

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01REiKFhP4w6xGXXqWKpPCJJ
This commit is contained in:
Kjell Tore Guttormsen 2026-06-19 06:22:48 +02:00
commit 41b390b38d
15 changed files with 69 additions and 30 deletions

View file

@ -1,6 +1,6 @@
# Cost Tracking & Chargeback via APIM Policies
**Last updated:** 2026-02
**Last updated:** 2026-06-19
**Status:** GA
**Category:** API Management & AI Gateway
@ -42,12 +42,9 @@ Den primære policyen for å emittere token-metriker til Azure Monitor:
<outbound>
<base />
<llm-emit-token-metric namespace="ai-cost-metrics">
<!-- Dimensjoner for kostnadsallokering -->
<!-- Maks 5 custom dimensions per policy (Azure Monitor-grense) -->
<dimension name="Subscription" value="@(context.Subscription.Name)" />
<dimension name="API" value="@(context.Api.Name)" />
<dimension name="Product" value="@(context.Product.Name)" />
<dimension name="ClientIP" value="@(context.Request.IpAddress)" />
<dimension name="Region" value="@(context.Deployment.Region)" />
<dimension name="UserId"
value="@(context.Request.Headers.GetValueOrDefault("X-User-Id", "unknown"))" />
<dimension name="Department"
@ -58,6 +55,8 @@ Den primære policyen for å emittere token-metriker til Azure Monitor:
</outbound>
```
**Viktig (MCP 2026-06):** `llm-emit-token-metric` tillater **maks 5 custom dimensions per policy** (Azure Monitor-grense — 5 default-dimensjoner brukes allerede av tjenesten; eksempelet over er derfor trimmet fra 8 til 5). Flere dimensjoner gir policy-feil. Policyen konfigureres i **inbound**-seksjonen og virker for OpenAI Chat Completions/Responses, **Anthropic Messages API** (API Management v2-tiers) og **Google Vertex AI**. Token-kategoriene inkluderer nå (preview) også cached-, reasoning- og thinking-tokens i tillegg til prompt/completion/total. Sett `include_usage=true` ved streaming, ellers blir token-tellingen unøyaktig.
### Token-typer og Kostnader
| Token-type | Beskrivelse | Kostnadsandel |

View file

@ -1,6 +1,6 @@
# Azure AI Services - Pricing Models and Cost Optimization
**Last updated:** 2026-02
**Last updated:** 2026-06-19
**Status:** GA
**Category:** Azure AI Services (Foundry Tools)
@ -199,6 +199,7 @@ PTU er en kapasitetsbasert prismodell for Azure OpenAI, primært for produksjons
- **Rate limiting:** Forhindre overskridelser
- **Circuit breaker:** Automatisk failover til billigere endepunkt
- **Load balancing:** Distribuer trafikk mellom PTU og pay-as-you-go
- **Multi-provider + Foundry (MCP 2026-06):** AI gateway styrer nå også Anthropic Messages API (v2-tiers) og Google Vertex AI, tilbyr unified model API (preview), og kan integreres direkte i Microsoft Foundry (preview) for sentral token-/kostnadsgovernance på tvers av modeller, agenter og verktøy
**Verified** Microsoft Learn: Generative AI Gateway Capabilities.

View file

@ -1,5 +1,5 @@
# Azure AI Services - Enterprise Architecture Patterns
**Last updated:** 2026-05 | Verified: MCP 2026-05
**Last updated:** 2026-06-19 | Verified: MCP 2026-06
**Status:** GA
**Category:** Azure AI Services (Foundry Tools)
@ -52,6 +52,13 @@ Azure AI Services (tidligere Cognitive Services) krever robuste enterprise-arkit
- Session affinity for conversational agents
- Health probes og automatic retry uten client-side delay
**Multi-provider og governance (MCP 2026-06):**
- AI gateway medierer nå flere LLM-skjemaer: OpenAI Chat Completions/Responses, **Anthropic Messages API** (API Management v2-tiers) og **Google Vertex AI** — i tillegg til modeller i Microsoft Foundry og ikke-Microsoft-leverandører (f.eks. Amazon Bedrock)
- **Unified model API (preview):** eksponerer flere backends gjennom ett OpenAI-kompatibelt endepunkt med automatisk format-oversettelse og felles policy-governance på tvers av modeller
- Styrer også **MCP-servere** og **A2A-agent-APIer** som backends, ikke bare språkmodeller
- **AI gateway i Microsoft Foundry (preview):** governance av modeller, agenter og verktøy direkte fra Foundry-miljøet (token-kvoter, throttling, content safety, telemetri i Foundry/Application Insights)
- Semantisk caching via **Azure Managed Redis** (RediSearch-kompatibel) med `llm-semantic-cache-store`/`-lookup`-policyer
**VIKTIG:** APIM circuit breaker for Azure OpenAI må håndtere `429 Too Many Requests` og respektere `Retry-After`-headeren (kan være opptil 24 timer).
### 3. Azure AI Search

View file

@ -1,6 +1,6 @@
# RAG Cost Optimization and Efficiency
**Last updated:** 2026-05
**Last updated:** 2026-06-19
**Status:** GA
**Category:** RAG Architecture & Semantic Search
@ -29,7 +29,9 @@ Valg av Azure AI Search pricing tier er avgjørende for total kostnad:
| **S3 HD** | Multitenant, mange små indekser | 200 GB | Høy | ~NOK 20,000 |
| **L1/L2** | Storage-optimized, sjeldne queries | 1 TB+ | Lavere | ~NOK 15,000+ |
**Viktig:** Services opprettet etter april 2024 får større partitions til samme pris. Basic-tier: 15 GB per partisjon (eldre services: 2 GB). S1: 25 GB per partisjon. Tier switching er nå støttet — du kan bytte mellom Basic og Standard S1 direkte uten å recreate servicen. Verified (MCP 2026-04).
**Viktig:** Services opprettet etter april 2024 får større partitions til samme pris. Basic-tier: 15 GB per partisjon (eldre services: 2 GB). S1: 25 GB per partisjon. Tier switching er nå støttet — du kan bytte mellom Basic og Standard (S1/S2/S3) direkte (config må ikke overstige target-tier; regionen må ha kapasitet). Verified (MCP 2026-04).
**NY prismodell — Serverless (Preview, MCP 2026-06):** Azure AI Search har nå to prismodeller — **Dedicated** (tabellen over, fast pris per Search Unit) og **Serverless (Preview)**, forbruksbasert (Compute Units/time + per-GB/mnd lagring), ingen compute-kost ved idle. Serverless passer sporadiske/bursty workloads og multitenant; Dedicated passer jevn, forutsigbar last. Per juni 2026 er Serverless Developer i preview (kun West Central US, Switzerland North, Japan East), uten SLA, og støtter ikke migrering til/fra Dedicated. **SU og CU er ikke utvekslbare** — ikke bruk SU-baserte kalkulatorer for Serverless.
### 2. Token Cost Reduction Strategies

View file

@ -1,6 +1,6 @@
# RAG at Enterprise Scale - Indexing and Serving
**Last updated:** 2026-04
**Last updated:** 2026-06-19
**Status:** GA
**Category:** RAG Architecture & Semantic Search
@ -150,7 +150,9 @@ For global enterprise-løsninger med latency-krav:
| **Standard S3** | 200 GB | Svært god | 20M+ dokumenter, continuous updates |
| **Storage Optimized L1** | 1 TB | Moderat | Arkiv-scenarier, sjeldne oppdateringer |
**Viktig**: Services opprettet etter 3. april 2024 har [høyere storage per partition](https://learn.microsoft.com/en-us/azure/search/search-limits-quotas-capacity#service-limits). Eldre services kan oppgraderes.
**Viktig**: Services opprettet etter 3. april 2024 har [høyere storage per partition](https://learn.microsoft.com/en-us/azure/search/search-limits-quotas-capacity#service-limits). Eldre services kan oppgraderes. Basic-services opprettet etter 3. april 2024 støtter nå opptil 3 partitions × 3 replicas (maks 9 SU); eldre Basic var begrenset til 1 partition × 3 replicas. Verified (MCP 2026-06).
**NY prismodell — Serverless (Preview, MCP 2026-06):** Ved siden av **Dedicated** (replicas × partitions = Search Units — hele dette dokumentets skaleringsmodell) tilbyr Azure AI Search nå **Serverless (Preview)**: forbruksbasert kapasitet som skalerer automatisk og **ned til null ved idle** (Compute Units/time + per-GB/mnd lagring). Microsoft peker eksplisitt på Serverless for «variable, bursty, or multitenant workloads, including agent-driven scenarios». For enterprise med jevn, forutsigbar last forblir Dedicated riktig; for sporadiske/agent-drevne workloads fjerner Serverless idle-kost. Per juni 2026 i preview (kun West Central US, Switzerland North, Japan East), uten SLA, ingen migrering til/fra Dedicated.
### Vanlige Feil