chore(ms-ai-architect): refresh KB critical-bucket — 15 files [skip-docs]

KB-currency refresh (critical priority, 2026-06-19) via /architect:kb-update.
15 critical cost/arkitektur-filer re-verifisert mot Microsoft Learn (MCP).

Hovedendringer:
- Azure AI Search Serverless (Preview) prismodell (rag-cost, rag-query,
  vector-storage, rag-enterprise-scale)
- Agentic retrieval GA-split (2026-04-01 REST GA, portal preview) + Foundry IQ
- AI gateway multi-provider (Anthropic v2 / Google Vertex), unified model API
  (preview), Foundry-integrasjon (enterprise-arch, ai-services-cost,
  multi-model, cost-tracking)
- FOCUS-skjema + Cost Mgmt -> ADLS Gen2 -> Fabric -> Power BI pipeline
  (cost-management, cost-allocation)
- FinOps hub AI-agent via Azure MCP / Copilot Studio (budget-forecasting)
- OTel trace-based sampling for logs (observability)
- Korreksjoner: semantic-cache score-threshold = AVSTAND (0.15, ikke 0.85
  cosine-likhet); llm-emit-token-metric maks 5 custom dimensions;
  Foundry RBAC-renames (Owner/Contributor = kun mgmt); Researcher/Analyst er
  ikke agenter
- Alle 15 Last updated -> 2026-06-19

High-bucket (49 filer) UTSATT til egen sesjon (operatoer-valg).

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01REiKFhP4w6xGXXqWKpPCJJ
This commit is contained in:
Kjell Tore Guttormsen 2026-06-19 06:22:48 +02:00
commit 41b390b38d
15 changed files with 69 additions and 30 deletions

View file

@ -1,6 +1,6 @@
# RAG at Enterprise Scale - Indexing and Serving
**Last updated:** 2026-04
**Last updated:** 2026-06-19
**Status:** GA
**Category:** RAG Architecture & Semantic Search
@ -150,7 +150,9 @@ For global enterprise-løsninger med latency-krav:
| **Standard S3** | 200 GB | Svært god | 20M+ dokumenter, continuous updates |
| **Storage Optimized L1** | 1 TB | Moderat | Arkiv-scenarier, sjeldne oppdateringer |
**Viktig**: Services opprettet etter 3. april 2024 har [høyere storage per partition](https://learn.microsoft.com/en-us/azure/search/search-limits-quotas-capacity#service-limits). Eldre services kan oppgraderes.
**Viktig**: Services opprettet etter 3. april 2024 har [høyere storage per partition](https://learn.microsoft.com/en-us/azure/search/search-limits-quotas-capacity#service-limits). Eldre services kan oppgraderes. Basic-services opprettet etter 3. april 2024 støtter nå opptil 3 partitions × 3 replicas (maks 9 SU); eldre Basic var begrenset til 1 partition × 3 replicas. Verified (MCP 2026-06).
**NY prismodell — Serverless (Preview, MCP 2026-06):** Ved siden av **Dedicated** (replicas × partitions = Search Units — hele dette dokumentets skaleringsmodell) tilbyr Azure AI Search nå **Serverless (Preview)**: forbruksbasert kapasitet som skalerer automatisk og **ned til null ved idle** (Compute Units/time + per-GB/mnd lagring). Microsoft peker eksplisitt på Serverless for «variable, bursty, or multitenant workloads, including agent-driven scenarios». For enterprise med jevn, forutsigbar last forblir Dedicated riktig; for sporadiske/agent-drevne workloads fjerner Serverless idle-kost. Per juni 2026 i preview (kun West Central US, Switzerland North, Japan East), uten SLA, ingen migrering til/fra Dedicated.
### Vanlige Feil