fix(ms-ai-architect): Spor 0 — 37 kilde-verifiserte KB-feil fikset (25 ref-filer), 1 avvist [skip-docs]

Per-kilde verifiserings-agenter (Opus xhigh, live microsoft_docs_fetch) bekreftet
hver verdi mot kilden FOER endring; alle forekomster av samme gale fakta fikset
fil-vidt (ikke bare sitert linje).

- 37/38 confirm-fix anvendt; #8 (model-selection «Model Router GA») AVVIST: fila var
  allerede korrekt (Model Router GA siden 2025-11-18); den siterte model-choice-guide
  har utdatert «(preview)»-etikett. AA «fikse» ville innfoert en feil.
- Tverteklynger reconciled til kilde-sann verdi: AI Search storage (S1 160/S2 512/S3
  1024/L1 2048/L2 4096 GB; vektor 5/35/150/300), Quota Tiers (erstatter
  Default/Enterprise + «1 Unit Capacity»).
- Hoey-innsats: realtime Schrems II omskrevet (global deployment != EU-residens,
  selv-verifisert mot kilde); Data Zone Norway East = gpt-5.4 OG gpt-5.5 (ikke kun
  5.5); computer-use = gpt-5.4 + computer-tool (region flagget for verifisering).
- Suite 552/552 groenn. Manifest oppdatert (fixed/verdict/verified per fiks).

Spor 1-froe (cross-fil-gjentakelser i UBEROERTE filer): «DDoS Protection Standard» i
ros-ai-threat-library.md + zero-trust-ai-services.md. Tilstoetende funn (ikke i de 38):
se docs / STATE.
This commit is contained in:
Kjell Tore Guttormsen 2026-06-29 09:39:20 +02:00
commit 2c54f0d5a0
26 changed files with 327 additions and 207 deletions

View file

@ -361,7 +361,7 @@ for doc in search_result:
### Lisensiering
- **Azure OpenAI Service:** Krever Azure-abonnement, ingen separate lisenser for embedding-modeller
- **Azure AI Search:** Basic tier fra $75/mnd (1 GB storage), Standard S1 fra $250/mnd (25 GB storage)
- **Azure AI Search:** Basic tier fra $75/mnd (15 GB storage per partisjon for nye services; eldre: 2 GB), Standard S1 fra $250/mnd (160 GB; eldre: 25 GB)
- **Custom embeddings (self-hosted):** Ingen lisenskostnad utover compute (Azure ML, Kubernetes)
---

View file

@ -10,7 +10,7 @@
Context window-størrelse er en av de mest kritiske faktorene som bestemmer kvaliteten og kostnaden for en RAG-løsning. En language model har en begrenset kapasitet for tokens den kan prosessere i en enkelt request — dette omtales som modellens context window. For RAG-implementasjoner må man balansere mellom å gi modellen nok kontekst til å generere gode svar, uten å overbelaste context window eller sløse med tokens (som koster penger).
Med innføringen av long-context models som GPT-4 Turbo (128k tokens) og GPT-4.1 (context windows opp til 200k+ tokens), har arkitekter fått nye muligheter: skal man fortsatt bruke klassisk RAG med retrieval av små, relevante chunks, eller kan man nå sende hele dokumenter direkte til modellen? Svaret avhenger av use case, kostnad, latency-krav og modellens faktiske evne til å utnytte store context windows — kjent som "lost-in-the-middle"-problemet.
Med innføringen av long-context models som GPT-4 Turbo (128k tokens) og GPT-4.1 (context windows opp til ~1M tokens), har arkitekter fått nye muligheter: skal man fortsatt bruke klassisk RAG med retrieval av små, relevante chunks, eller kan man nå sende hele dokumenter direkte til modellen? Svaret avhenger av use case, kostnad, latency-krav og modellens faktiske evne til å utnytte store context windows — kjent som "lost-in-the-middle"-problemet.
I denne kunnskapsreferansen dekkes token budgeting, context window management, og når man skal velge RAG-basert chunking versus long-context direct prompting, med fokus på Azure OpenAI-modeller og integrasjon i Microsoft-stakken.
@ -29,9 +29,9 @@ I denne kunnskapsreferansen dekkes token budgeting, context window management, o
**Verified (Azure OpenAI):**
- GPT-4 Turbo: 128k tokens context window
- GPT-4.1 series: Opp til 200k+ tokens context window
- GPT-4.1 series: ~1M tokens context window (maks 1 047 576; standard-deployments 300k, provisioned managed/batch 128k)
- GPT-4o: 128k tokens
- o1-series: Varierende (o1: 200k, o3-mini: 128k)
- o1-series: Varierende (o1: 200k, o3-mini: 200k input / 100k output)
### Token Budget Allocation
@ -49,7 +49,7 @@ For GPT-4 Turbo (128k context):
- Retrieved context: Max 30-50k tokens (ikke hele window)
- Response buffer: 2-4k tokens
For GPT-4.1 (200k context):
For GPT-4.1 (~1M context):
- Retrieved context: Kan økes til 100k tokens, men kvalitet avtar (lost-in-the-middle)
- Reserved: 10-15k tokens
@ -82,7 +82,7 @@ Studier viser at LLMs har svakere performance når relevant informasjon er plass
| Modell | Context Window | Anbefalt RAG-strategi |
|--------|---------------|----------------------|
| GPT-4 Turbo | 128k | Klassisk RAG (top-10 til top-50 chunks) |
| GPT-4.1 | 200k+ | Hybrid: RAG for precision queries, long-context for exploratory |
| GPT-4.1 | ~1M | Hybrid: RAG for precision queries, long-context for exploratory |
| GPT-4o | 128k | Klassisk RAG med hybrid search |
| o1-series | 200k | Long-context for reasoning tasks, RAG for factual grounding |
@ -200,14 +200,16 @@ Sjeldnere brukt, men effektiv for spesialiserte domener.
### Azure OpenAI Context Limits (Verified)
| Modell | Context Window | TPM (Default tier) | TPM (Enterprise tier) |
|--------|---------------|-------------------|----------------------|
| gpt-4 (turbo-2024-04-09) | 128k | 450k | 2M |
| gpt-4.1 | 200k+ | 1M | 5M |
| gpt-4o | 128k | 450k | 30M |
| gpt-4o-mini | 128k | 2M | 150M |
| o1 | 200k | 3M | 30M |
| o3-mini | 128k | 5M | 50M |
| Modell | Context Window |
|--------|---------------|
| gpt-4 (turbo-2024-04-09) | 128k |
| gpt-4.1 | ~1M (1 047 576) |
| gpt-4o | 128k |
| gpt-4o-mini | 128k |
| o1 | 200k |
| o3-mini | 200k input / 100k output |
**TPM-grenser (Quota Tiers):** Det tidligere to-nivå-systemet «Default tier / Enterprise tier» er erstattet av **Quota Tiers** — Free Tier (Tier 0) pluss Tier 16 (Tier 6 høyest), med kvote som øker automatisk med forbruk. TPM/RPM defineres per region, per subscription og per modell/deployment-type. Eksempel GlobalStandard TPM (Tier 1 → Tier 6): gpt-4.1 1M → 45M; gpt-4o-mini 2M → 225M; o1 3M → 48M; o3-mini 5M → 80M. Maks TPM (Tier 6) = 225M. Se [quotas-limits](https://learn.microsoft.com/azure/foundry/openai/quotas-limits) for full per-tier-tabell.
**Viktig:**
TPM (Tokens Per Minute) = Max tokens som kan prosesseres per minutt på deployment-nivå. Hvis du sender én request med 50k input tokens + 2k output tokens = 52k tokens → teller mot TPM.
@ -319,9 +321,9 @@ Hvis du har 10,000 queries per måned: **11,300 NOK/måned** (kun LLM-kostnad, i
3. **Batch processing** for ikke-interaktive workloads (Azure OpenAI Batch API: 50% rabatt)
4. **Monitorering**: Bruk Azure Monitor for å spore token usage per deployment
**Verified (Azure OpenAI Batch Quota):**
- gpt-4.1: 500M tokens per month (Enterprise tier), 30M (Default tier)
- gpt-4o: 500M (Enterprise), 30M (Default)
**Batch-kvote (Azure OpenAI — nå per Quota Tier; tidligere «Default/Enterprise»):**
- gpt-4.1: ~500M tokens/måned (øvre tier), ~30M (lavere tier) — ikke re-verifisert mot gjeldende per-tier-tabell, se quotas-limits
- gpt-4o: ~500M (øvre), ~30M (lavere) — samme forbehold
---

View file

@ -24,12 +24,12 @@ Valg av Azure AI Search pricing tier er avgjørende for total kostnad:
|------|----------|---------|-----------|-------------------|
| **Free** | POC, testing | 50 MB | Begrenset | NOK 0 |
| **Basic** | Små produksjonsløsninger | 15 GB (services opprettet etter april 2024; eldre: 2 GB) | Moderat | ~NOK 700 | Verified (MCP 2026-04) |
| **S1** | Standard produksjon | 25 GB/partition | Høy | ~NOK 2,500 |
| **S2** | Store løsninger | 100 GB/partition | Meget høy | ~NOK 10,000 |
| **S3 HD** | Multitenant, mange små indekser | 200 GB | Høy | ~NOK 20,000 |
| **L1/L2** | Storage-optimized, sjeldne queries | 1 TB+ | Lavere | ~NOK 15,000+ |
| **S1** | Standard produksjon | 160 GB/partition | Høy | ~NOK 2,500 |
| **S2** | Store løsninger | 512 GB/partition | Meget høy | ~NOK 10,000 |
| **S3 HD** | Multitenant, mange små indekser | 1 024 GB/partition | Høy | ~NOK 20,000 |
| **L1/L2** | Storage-optimized, sjeldne queries | 2 TB (L1) / 4 TB (L2) | Lavere | ~NOK 15,000+ |
**Viktig:** Services opprettet etter april 2024 får større partitions til samme pris. Basic-tier: 15 GB per partisjon (eldre services: 2 GB). S1: 25 GB per partisjon. Tier switching er nå støttet — du kan bytte mellom Basic og Standard (S1/S2/S3) direkte (config må ikke overstige target-tier; regionen må ha kapasitet). Verified (MCP 2026-04).
**Viktig:** Services opprettet etter april 2024 får større partitions til samme pris. Basic-tier: 15 GB per partisjon (eldre services: 2 GB). S1: 160 GB per partisjon. Tier switching er nå støttet — du kan bytte mellom Basic og Standard (S1/S2/S3) direkte (config må ikke overstige target-tier; regionen må ha kapasitet). Verified (MCP 2026-04).
**NY prismodell — Serverless (Preview, MCP 2026-06):** Azure AI Search har nå to prismodeller — **Dedicated** (tabellen over, fast pris per Search Unit) og **Serverless (Preview)**, forbruksbasert (Compute Units/time + per-GB/mnd lagring), ingen compute-kost ved idle. Serverless passer sporadiske/bursty workloads og multitenant; Dedicated passer jevn, forutsigbar last. Per juni 2026 er Serverless Developer i preview (kun West Central US, Switzerland North, Japan East), uten SLA, og støtter ikke migrering til/fra Dedicated. **SU og CU er ikke utvekslbare** — ikke bruk SU-baserte kalkulatorer for Serverless.
@ -350,12 +350,12 @@ Metrics:
|------|-------------------|-------------------|-------------------|------|
| Free | 0.00 | 0 | 1 | 50 MB, 1 index limit |
| Basic | ~1.00 | ~730 | 1-3 | 15 GB per partition (etter april 2024) | Verified (MCP 2026-04) |
| S1 | ~3.50 | ~2,555 | 1-36 | 25 GB per partition |
| S2 | ~13.50 | ~9,855 | 1-36 | 100 GB per partition |
| S3 | ~27.00 | ~19,710 | 1-36 | 200 GB per partition |
| S1 | ~3.50 | ~2,555 | 1-36 | 160 GB per partition |
| S2 | ~13.50 | ~9,855 | 1-36 | 512 GB per partition |
| S3 | ~27.00 | ~19,710 | 1-36 | 1 024 GB per partition |
| S3 HD | ~27.00 | ~19,710 | 1-36 | Optimalisert for mange indekser |
| L1 | ~20.00 | ~14,600 | 1-12 | 1 TB per partition |
| L2 | ~40.00 | ~29,200 | 1-12 | 2 TB per partition |
| L1 | ~20.00 | ~14,600 | 1-36 | 2 TB per partition |
| L2 | ~40.00 | ~29,200 | 1-36 | 4 TB per partition |
**Viktig:** Kostnader = Base rate × (replicas × partitions). Eks: S1 med 2 replicas og 2 partitions = 4 SU = NOK 10,220/mnd.