fix(ms-ai-architect): Spor 0 — 37 kilde-verifiserte KB-feil fikset (25 ref-filer), 1 avvist [skip-docs]

Per-kilde verifiserings-agenter (Opus xhigh, live microsoft_docs_fetch) bekreftet
hver verdi mot kilden FOER endring; alle forekomster av samme gale fakta fikset
fil-vidt (ikke bare sitert linje).

- 37/38 confirm-fix anvendt; #8 (model-selection «Model Router GA») AVVIST: fila var
  allerede korrekt (Model Router GA siden 2025-11-18); den siterte model-choice-guide
  har utdatert «(preview)»-etikett. AA «fikse» ville innfoert en feil.
- Tverteklynger reconciled til kilde-sann verdi: AI Search storage (S1 160/S2 512/S3
  1024/L1 2048/L2 4096 GB; vektor 5/35/150/300), Quota Tiers (erstatter
  Default/Enterprise + «1 Unit Capacity»).
- Hoey-innsats: realtime Schrems II omskrevet (global deployment != EU-residens,
  selv-verifisert mot kilde); Data Zone Norway East = gpt-5.4 OG gpt-5.5 (ikke kun
  5.5); computer-use = gpt-5.4 + computer-tool (region flagget for verifisering).
- Suite 552/552 groenn. Manifest oppdatert (fixed/verdict/verified per fiks).

Spor 1-froe (cross-fil-gjentakelser i UBEROERTE filer): «DDoS Protection Standard» i
ros-ai-threat-library.md + zero-trust-ai-services.md. Tilstoetende funn (ikke i de 38):
se docs / STATE.
This commit is contained in:
Kjell Tore Guttormsen 2026-06-29 09:39:20 +02:00
commit 2c54f0d5a0
26 changed files with 327 additions and 207 deletions

View file

@ -62,7 +62,7 @@ PTU er en kapasitetsbasert prismodell for Azure OpenAI, primært for produksjons
**Fakturering:**
- **Timepris:** Beregnes per PTU per time ($/PTU/hr)
- **Pro-rata:** Delvis time faktureres proporsjonalt (15 min = 1/4 timepris)
- **Reservasjonsrabatt:** 1-års eller 3-års Azure Reservations gir betydelige rabatter (opptil 50 % besparelse)
- **Reservasjonsrabatt:** 1-måneds eller 1-års Azure Reservations gir betydelige rabatter (ingen 3-årstermin for Foundry PTU; faktisk rabatt varierer per modellfamilie og term)
**Kapasitetsplanlegging:**
- Bruk **Foundry PTU Calculator** (tilgjengelig i Microsoft Foundry portal)
@ -109,7 +109,7 @@ PTU er en kapasitetsbasert prismodell for Azure OpenAI, primært for produksjons
- Vurder PTU for Azure OpenAI med SLA-krav
**Fase 3 (Optimalisering):** Reservasjoner + Tagging
- Kjøp 1-års eller 3-års PTU-reservasjon
- Kjøp 1-måneds eller 1-års PTU-reservasjon
- Bruk tags for kostnadsallokering per prosjekt/team
**Verified** Microsoft Learn: Plan and Manage Costs for Azure OpenAI.
@ -156,7 +156,7 @@ PTU er en kapasitetsbasert prismodell for Azure OpenAI, primært for produksjons
- Azure OpenAI i produksjon
- SLA-krav (latency, throughput)
- Høy, forutsigbar trafikk (> 100K tokens/dag)
- Langsiktig forpliktelse (1-3 år reservasjon gir best ROI)
- Langsiktig forpliktelse (1-års reservasjon gir best ROI; 3-årstermin finnes ikke for Foundry PTU)
❌ **Ikke bruk når:**
- Lav trafikk eller pilot-fase
@ -307,7 +307,7 @@ PTU er en kapasitetsbasert prismodell for Azure OpenAI, primært for produksjons
1. "Er dette Azure OpenAI i produksjon?"
2. "Har dere latency/throughput-krav i SLA?"
3. "Er trafikken forutsigbar (> 100K tokens/dag)?"
4. "Kan dere forplikte deg til 1-3 år?"
4. "Kan dere forplikte deg til 1 år?"
**Anbefaling:**
- Hvis JA på alle → **Anbefal PTU med 1-års reservasjon**

View file

@ -106,7 +106,7 @@ Microsoft tilbyr flere nivåer av AI-tjenester under paraplynavnet "Azure AI Ser
**Nøkkelkapabiliteter:**
- **Agent Service:** Managed runtime for agentic AI (conversation state, tool orchestration, safety enforcement)
- **Model Catalog:** 100+ modeller fra Microsoft, OpenAI, Anthropic, Meta, Mistral, Cohere
- **Model Catalog:** over 1 900 modeller fra Microsoft, OpenAI, Anthropic, Meta, Mistral, Cohere
- **Connected agents:** Integrasjon med Azure AI Search, SharePoint, Bing, Azure Functions, Logic Apps
- **Workflows:** YAML-basert multi-agent orkestrering med visual designer
- **Observability:** Built-in tracing via Application Insights (traces, evaluations, conversation-level visibility)
@ -124,17 +124,16 @@ Microsoft tilbyr flere nivåer av AI-tjenester under paraplynavnet "Azure AI Ser
**Definisjon:** Spesialisert tjeneste for å få tilgang til OpenAI-modeller (GPT, DALL-E, Whisper, Embeddings) med Azure enterprise-fordeler (sikkerhet, compliance, SLA).
#### Modellserie (2026-02)
#### Modellserie (2026-06)
| Modell | Bruksområde | Deployment-typer |
|--------|-------------|------------------|
| **o4-mini** | Reasoning, kompleks problemløsning | Standard, Global Standard |
| **o3, o3-mini** | Avansert reasoning | Standard, Provisioned Throughput |
| **GPT-5-generasjonen** (GPT-5/5.1/5.2/5.4/5.5 + -mini/-nano/-codex) | Ledende reasoning og chat (flaggskip; GPT-5.5 nyest) | Se region-verifisert `model-catalog-2026.md` |
| **GPT-4.1, GPT-4.1-mini, GPT-4.1-nano** | Lang kontekst (~1M tokens), kostnadsspekter | Standard, Global Standard, Provisioned |
| **o4-mini, o3, o3-mini** | Eldre o-serie reasoning (erstattet av GPT-5-gen for nye design) | Standard, Provisioned |
| **GPT-4o, GPT-4o-mini** | Chat, multimodal (tekst/bilde) | Standard, Global Standard, Provisioned |
| **GPT-4 Turbo** | Long-context tasks (128k tokens) | Standard, Provisioned |
| **GPT-3.5-Turbo** | Kostnadseffektiv chat | Standard, Global Standard |
| **DALL-E 3** | Bildegenerering | Standard |
| **Whisper** | Speech-to-text | Standard |
| **Bildegenerering (GPT-image / DALL-E 3)** | Bildegenerering | Standard |
| **Whisper / gpt-4o-transcribe** | Tale-til-tekst | Standard |
| **Embeddings** (text-embedding-3) | Vektorisering for RAG | Standard |
#### Deployment-typer
@ -529,7 +528,7 @@ START: Hvilken AI-kapabilitet trenger du?
**Faktorer som påvirker kostnad:**
1. **Volum:** Antall API-kall, tokens, bilder, minutter audio
2. **Modellvalg:** GPT-4o > GPT-4o-mini > GPT-3.5-Turbo (kostnad)
2. **Modellvalg:** GPT-4o > GPT-4o-mini > GPT-4.1-nano (kostnad)
3. **Deployment-type:** PTU > Standard > Global Standard
4. **Region:** Noen regioner er dyrere (f.eks. EU vs. US East)
5. **Features:** Content Safety, fine-tuning, hosting (Azure OpenAI)

View file

@ -143,7 +143,7 @@ MLflow Tracing provides end-to-end observability for GenAI applications:
**Hva:** Unified platform for GenAI lifecycle management.
**GenAIOps capabilities:**
- **Model Catalog**: Browse 1600+ foundation models (OpenAI, Meta, Mistral, Cohere)
- **Model Catalog**: Browse over 1,900 models (OpenAI, Meta, Mistral, Cohere)
- **Prompt Flow**: Visual designer for LLM workflows
- **Evaluation SDK**: Built-in evaluators (groundedness, relevance, coherence, fluency, safety)
- **Content Safety**: Real-time filtering (hate, violence, sexual, self-harm)

View file

@ -579,9 +579,6 @@ MLflow 3 (SDK `mlflow[databricks]>=3.1`) introduces a unified evaluation model:
| `RetrievalGroundedness` | No | Hallucination detection |
| `Safety` | No | Harmful/toxic content |
| `Correctness` | Yes | Accuracy vs ground truth |
| `Completeness` | Yes | All questions addressed |
| `Fluency` | No | Grammatically correct and naturally flowing |
| `Equivalence` | Yes | Response equivalent to expected output |
| `RetrievalSufficiency` | Yes | Context provides all necessary information |
| `ToolCallCorrectness` | Yes | Tool calls and arguments |
| `ToolCallEfficiency` | No | Redundant tool usage |
@ -1112,7 +1109,7 @@ Dette området utvikler seg raskt. Anbefalt re-verification:
- **Annually:** Compliance requirements (AI Act implementation guidance evolves)
**Siste research-dato:** 2026-06-19
**Kilder brukt:** 7 Microsoft Learn articles, 15 code samples, Azure AI Evaluation SDK v1.14.0
**Kilder brukt:** 7 Microsoft Learn articles, 15 code samples, Azure AI Evaluation SDK v1.17.0
---

View file

@ -361,7 +361,7 @@ for doc in search_result:
### Lisensiering
- **Azure OpenAI Service:** Krever Azure-abonnement, ingen separate lisenser for embedding-modeller
- **Azure AI Search:** Basic tier fra $75/mnd (1 GB storage), Standard S1 fra $250/mnd (25 GB storage)
- **Azure AI Search:** Basic tier fra $75/mnd (15 GB storage per partisjon for nye services; eldre: 2 GB), Standard S1 fra $250/mnd (160 GB; eldre: 25 GB)
- **Custom embeddings (self-hosted):** Ingen lisenskostnad utover compute (Azure ML, Kubernetes)
---

View file

@ -10,7 +10,7 @@
Context window-størrelse er en av de mest kritiske faktorene som bestemmer kvaliteten og kostnaden for en RAG-løsning. En language model har en begrenset kapasitet for tokens den kan prosessere i en enkelt request — dette omtales som modellens context window. For RAG-implementasjoner må man balansere mellom å gi modellen nok kontekst til å generere gode svar, uten å overbelaste context window eller sløse med tokens (som koster penger).
Med innføringen av long-context models som GPT-4 Turbo (128k tokens) og GPT-4.1 (context windows opp til 200k+ tokens), har arkitekter fått nye muligheter: skal man fortsatt bruke klassisk RAG med retrieval av små, relevante chunks, eller kan man nå sende hele dokumenter direkte til modellen? Svaret avhenger av use case, kostnad, latency-krav og modellens faktiske evne til å utnytte store context windows — kjent som "lost-in-the-middle"-problemet.
Med innføringen av long-context models som GPT-4 Turbo (128k tokens) og GPT-4.1 (context windows opp til ~1M tokens), har arkitekter fått nye muligheter: skal man fortsatt bruke klassisk RAG med retrieval av små, relevante chunks, eller kan man nå sende hele dokumenter direkte til modellen? Svaret avhenger av use case, kostnad, latency-krav og modellens faktiske evne til å utnytte store context windows — kjent som "lost-in-the-middle"-problemet.
I denne kunnskapsreferansen dekkes token budgeting, context window management, og når man skal velge RAG-basert chunking versus long-context direct prompting, med fokus på Azure OpenAI-modeller og integrasjon i Microsoft-stakken.
@ -29,9 +29,9 @@ I denne kunnskapsreferansen dekkes token budgeting, context window management, o
**Verified (Azure OpenAI):**
- GPT-4 Turbo: 128k tokens context window
- GPT-4.1 series: Opp til 200k+ tokens context window
- GPT-4.1 series: ~1M tokens context window (maks 1 047 576; standard-deployments 300k, provisioned managed/batch 128k)
- GPT-4o: 128k tokens
- o1-series: Varierende (o1: 200k, o3-mini: 128k)
- o1-series: Varierende (o1: 200k, o3-mini: 200k input / 100k output)
### Token Budget Allocation
@ -49,7 +49,7 @@ For GPT-4 Turbo (128k context):
- Retrieved context: Max 30-50k tokens (ikke hele window)
- Response buffer: 2-4k tokens
For GPT-4.1 (200k context):
For GPT-4.1 (~1M context):
- Retrieved context: Kan økes til 100k tokens, men kvalitet avtar (lost-in-the-middle)
- Reserved: 10-15k tokens
@ -82,7 +82,7 @@ Studier viser at LLMs har svakere performance når relevant informasjon er plass
| Modell | Context Window | Anbefalt RAG-strategi |
|--------|---------------|----------------------|
| GPT-4 Turbo | 128k | Klassisk RAG (top-10 til top-50 chunks) |
| GPT-4.1 | 200k+ | Hybrid: RAG for precision queries, long-context for exploratory |
| GPT-4.1 | ~1M | Hybrid: RAG for precision queries, long-context for exploratory |
| GPT-4o | 128k | Klassisk RAG med hybrid search |
| o1-series | 200k | Long-context for reasoning tasks, RAG for factual grounding |
@ -200,14 +200,16 @@ Sjeldnere brukt, men effektiv for spesialiserte domener.
### Azure OpenAI Context Limits (Verified)
| Modell | Context Window | TPM (Default tier) | TPM (Enterprise tier) |
|--------|---------------|-------------------|----------------------|
| gpt-4 (turbo-2024-04-09) | 128k | 450k | 2M |
| gpt-4.1 | 200k+ | 1M | 5M |
| gpt-4o | 128k | 450k | 30M |
| gpt-4o-mini | 128k | 2M | 150M |
| o1 | 200k | 3M | 30M |
| o3-mini | 128k | 5M | 50M |
| Modell | Context Window |
|--------|---------------|
| gpt-4 (turbo-2024-04-09) | 128k |
| gpt-4.1 | ~1M (1 047 576) |
| gpt-4o | 128k |
| gpt-4o-mini | 128k |
| o1 | 200k |
| o3-mini | 200k input / 100k output |
**TPM-grenser (Quota Tiers):** Det tidligere to-nivå-systemet «Default tier / Enterprise tier» er erstattet av **Quota Tiers** — Free Tier (Tier 0) pluss Tier 16 (Tier 6 høyest), med kvote som øker automatisk med forbruk. TPM/RPM defineres per region, per subscription og per modell/deployment-type. Eksempel GlobalStandard TPM (Tier 1 → Tier 6): gpt-4.1 1M → 45M; gpt-4o-mini 2M → 225M; o1 3M → 48M; o3-mini 5M → 80M. Maks TPM (Tier 6) = 225M. Se [quotas-limits](https://learn.microsoft.com/azure/foundry/openai/quotas-limits) for full per-tier-tabell.
**Viktig:**
TPM (Tokens Per Minute) = Max tokens som kan prosesseres per minutt på deployment-nivå. Hvis du sender én request med 50k input tokens + 2k output tokens = 52k tokens → teller mot TPM.
@ -319,9 +321,9 @@ Hvis du har 10,000 queries per måned: **11,300 NOK/måned** (kun LLM-kostnad, i
3. **Batch processing** for ikke-interaktive workloads (Azure OpenAI Batch API: 50% rabatt)
4. **Monitorering**: Bruk Azure Monitor for å spore token usage per deployment
**Verified (Azure OpenAI Batch Quota):**
- gpt-4.1: 500M tokens per month (Enterprise tier), 30M (Default tier)
- gpt-4o: 500M (Enterprise), 30M (Default)
**Batch-kvote (Azure OpenAI — nå per Quota Tier; tidligere «Default/Enterprise»):**
- gpt-4.1: ~500M tokens/måned (øvre tier), ~30M (lavere tier) — ikke re-verifisert mot gjeldende per-tier-tabell, se quotas-limits
- gpt-4o: ~500M (øvre), ~30M (lavere) — samme forbehold
---

View file

@ -24,12 +24,12 @@ Valg av Azure AI Search pricing tier er avgjørende for total kostnad:
|------|----------|---------|-----------|-------------------|
| **Free** | POC, testing | 50 MB | Begrenset | NOK 0 |
| **Basic** | Små produksjonsløsninger | 15 GB (services opprettet etter april 2024; eldre: 2 GB) | Moderat | ~NOK 700 | Verified (MCP 2026-04) |
| **S1** | Standard produksjon | 25 GB/partition | Høy | ~NOK 2,500 |
| **S2** | Store løsninger | 100 GB/partition | Meget høy | ~NOK 10,000 |
| **S3 HD** | Multitenant, mange små indekser | 200 GB | Høy | ~NOK 20,000 |
| **L1/L2** | Storage-optimized, sjeldne queries | 1 TB+ | Lavere | ~NOK 15,000+ |
| **S1** | Standard produksjon | 160 GB/partition | Høy | ~NOK 2,500 |
| **S2** | Store løsninger | 512 GB/partition | Meget høy | ~NOK 10,000 |
| **S3 HD** | Multitenant, mange små indekser | 1 024 GB/partition | Høy | ~NOK 20,000 |
| **L1/L2** | Storage-optimized, sjeldne queries | 2 TB (L1) / 4 TB (L2) | Lavere | ~NOK 15,000+ |
**Viktig:** Services opprettet etter april 2024 får større partitions til samme pris. Basic-tier: 15 GB per partisjon (eldre services: 2 GB). S1: 25 GB per partisjon. Tier switching er nå støttet — du kan bytte mellom Basic og Standard (S1/S2/S3) direkte (config må ikke overstige target-tier; regionen må ha kapasitet). Verified (MCP 2026-04).
**Viktig:** Services opprettet etter april 2024 får større partitions til samme pris. Basic-tier: 15 GB per partisjon (eldre services: 2 GB). S1: 160 GB per partisjon. Tier switching er nå støttet — du kan bytte mellom Basic og Standard (S1/S2/S3) direkte (config må ikke overstige target-tier; regionen må ha kapasitet). Verified (MCP 2026-04).
**NY prismodell — Serverless (Preview, MCP 2026-06):** Azure AI Search har nå to prismodeller — **Dedicated** (tabellen over, fast pris per Search Unit) og **Serverless (Preview)**, forbruksbasert (Compute Units/time + per-GB/mnd lagring), ingen compute-kost ved idle. Serverless passer sporadiske/bursty workloads og multitenant; Dedicated passer jevn, forutsigbar last. Per juni 2026 er Serverless Developer i preview (kun West Central US, Switzerland North, Japan East), uten SLA, og støtter ikke migrering til/fra Dedicated. **SU og CU er ikke utvekslbare** — ikke bruk SU-baserte kalkulatorer for Serverless.
@ -350,12 +350,12 @@ Metrics:
|------|-------------------|-------------------|-------------------|------|
| Free | 0.00 | 0 | 1 | 50 MB, 1 index limit |
| Basic | ~1.00 | ~730 | 1-3 | 15 GB per partition (etter april 2024) | Verified (MCP 2026-04) |
| S1 | ~3.50 | ~2,555 | 1-36 | 25 GB per partition |
| S2 | ~13.50 | ~9,855 | 1-36 | 100 GB per partition |
| S3 | ~27.00 | ~19,710 | 1-36 | 200 GB per partition |
| S1 | ~3.50 | ~2,555 | 1-36 | 160 GB per partition |
| S2 | ~13.50 | ~9,855 | 1-36 | 512 GB per partition |
| S3 | ~27.00 | ~19,710 | 1-36 | 1 024 GB per partition |
| S3 HD | ~27.00 | ~19,710 | 1-36 | Optimalisert for mange indekser |
| L1 | ~20.00 | ~14,600 | 1-12 | 1 TB per partition |
| L2 | ~40.00 | ~29,200 | 1-12 | 2 TB per partition |
| L1 | ~20.00 | ~14,600 | 1-36 | 2 TB per partition |
| L2 | ~40.00 | ~29,200 | 1-36 | 4 TB per partition |
**Viktig:** Kostnader = Base rate × (replicas × partitions). Eks: S1 med 2 replicas og 2 partitions = 4 SU = NOK 10,220/mnd.