fix(ms-ai-architect): Spor 0 — 37 kilde-verifiserte KB-feil fikset (25 ref-filer), 1 avvist [skip-docs]
Per-kilde verifiserings-agenter (Opus xhigh, live microsoft_docs_fetch) bekreftet hver verdi mot kilden FOER endring; alle forekomster av samme gale fakta fikset fil-vidt (ikke bare sitert linje). - 37/38 confirm-fix anvendt; #8 (model-selection «Model Router GA») AVVIST: fila var allerede korrekt (Model Router GA siden 2025-11-18); den siterte model-choice-guide har utdatert «(preview)»-etikett. AA «fikse» ville innfoert en feil. - Tverteklynger reconciled til kilde-sann verdi: AI Search storage (S1 160/S2 512/S3 1024/L1 2048/L2 4096 GB; vektor 5/35/150/300), Quota Tiers (erstatter Default/Enterprise + «1 Unit Capacity»). - Hoey-innsats: realtime Schrems II omskrevet (global deployment != EU-residens, selv-verifisert mot kilde); Data Zone Norway East = gpt-5.4 OG gpt-5.5 (ikke kun 5.5); computer-use = gpt-5.4 + computer-tool (region flagget for verifisering). - Suite 552/552 groenn. Manifest oppdatert (fixed/verdict/verified per fiks). Spor 1-froe (cross-fil-gjentakelser i UBEROERTE filer): «DDoS Protection Standard» i ros-ai-threat-library.md + zero-trust-ai-services.md. Tilstoetende funn (ikke i de 38): se docs / STATE.
This commit is contained in:
parent
2b6fb62f53
commit
2c54f0d5a0
26 changed files with 327 additions and 207 deletions
|
|
@ -10,7 +10,7 @@
|
|||
|
||||
Context window-størrelse er en av de mest kritiske faktorene som bestemmer kvaliteten og kostnaden for en RAG-løsning. En language model har en begrenset kapasitet for tokens den kan prosessere i en enkelt request — dette omtales som modellens context window. For RAG-implementasjoner må man balansere mellom å gi modellen nok kontekst til å generere gode svar, uten å overbelaste context window eller sløse med tokens (som koster penger).
|
||||
|
||||
Med innføringen av long-context models som GPT-4 Turbo (128k tokens) og GPT-4.1 (context windows opp til 200k+ tokens), har arkitekter fått nye muligheter: skal man fortsatt bruke klassisk RAG med retrieval av små, relevante chunks, eller kan man nå sende hele dokumenter direkte til modellen? Svaret avhenger av use case, kostnad, latency-krav og modellens faktiske evne til å utnytte store context windows — kjent som "lost-in-the-middle"-problemet.
|
||||
Med innføringen av long-context models som GPT-4 Turbo (128k tokens) og GPT-4.1 (context windows opp til ~1M tokens), har arkitekter fått nye muligheter: skal man fortsatt bruke klassisk RAG med retrieval av små, relevante chunks, eller kan man nå sende hele dokumenter direkte til modellen? Svaret avhenger av use case, kostnad, latency-krav og modellens faktiske evne til å utnytte store context windows — kjent som "lost-in-the-middle"-problemet.
|
||||
|
||||
I denne kunnskapsreferansen dekkes token budgeting, context window management, og når man skal velge RAG-basert chunking versus long-context direct prompting, med fokus på Azure OpenAI-modeller og integrasjon i Microsoft-stakken.
|
||||
|
||||
|
|
@ -29,9 +29,9 @@ I denne kunnskapsreferansen dekkes token budgeting, context window management, o
|
|||
|
||||
**Verified (Azure OpenAI):**
|
||||
- GPT-4 Turbo: 128k tokens context window
|
||||
- GPT-4.1 series: Opp til 200k+ tokens context window
|
||||
- GPT-4.1 series: ~1M tokens context window (maks 1 047 576; standard-deployments 300k, provisioned managed/batch 128k)
|
||||
- GPT-4o: 128k tokens
|
||||
- o1-series: Varierende (o1: 200k, o3-mini: 128k)
|
||||
- o1-series: Varierende (o1: 200k, o3-mini: 200k input / 100k output)
|
||||
|
||||
### Token Budget Allocation
|
||||
|
||||
|
|
@ -49,7 +49,7 @@ For GPT-4 Turbo (128k context):
|
|||
- Retrieved context: Max 30-50k tokens (ikke hele window)
|
||||
- Response buffer: 2-4k tokens
|
||||
|
||||
For GPT-4.1 (200k context):
|
||||
For GPT-4.1 (~1M context):
|
||||
- Retrieved context: Kan økes til 100k tokens, men kvalitet avtar (lost-in-the-middle)
|
||||
- Reserved: 10-15k tokens
|
||||
|
||||
|
|
@ -82,7 +82,7 @@ Studier viser at LLMs har svakere performance når relevant informasjon er plass
|
|||
| Modell | Context Window | Anbefalt RAG-strategi |
|
||||
|--------|---------------|----------------------|
|
||||
| GPT-4 Turbo | 128k | Klassisk RAG (top-10 til top-50 chunks) |
|
||||
| GPT-4.1 | 200k+ | Hybrid: RAG for precision queries, long-context for exploratory |
|
||||
| GPT-4.1 | ~1M | Hybrid: RAG for precision queries, long-context for exploratory |
|
||||
| GPT-4o | 128k | Klassisk RAG med hybrid search |
|
||||
| o1-series | 200k | Long-context for reasoning tasks, RAG for factual grounding |
|
||||
|
||||
|
|
@ -200,14 +200,16 @@ Sjeldnere brukt, men effektiv for spesialiserte domener.
|
|||
|
||||
### Azure OpenAI Context Limits (Verified)
|
||||
|
||||
| Modell | Context Window | TPM (Default tier) | TPM (Enterprise tier) |
|
||||
|--------|---------------|-------------------|----------------------|
|
||||
| gpt-4 (turbo-2024-04-09) | 128k | 450k | 2M |
|
||||
| gpt-4.1 | 200k+ | 1M | 5M |
|
||||
| gpt-4o | 128k | 450k | 30M |
|
||||
| gpt-4o-mini | 128k | 2M | 150M |
|
||||
| o1 | 200k | 3M | 30M |
|
||||
| o3-mini | 128k | 5M | 50M |
|
||||
| Modell | Context Window |
|
||||
|--------|---------------|
|
||||
| gpt-4 (turbo-2024-04-09) | 128k |
|
||||
| gpt-4.1 | ~1M (1 047 576) |
|
||||
| gpt-4o | 128k |
|
||||
| gpt-4o-mini | 128k |
|
||||
| o1 | 200k |
|
||||
| o3-mini | 200k input / 100k output |
|
||||
|
||||
**TPM-grenser (Quota Tiers):** Det tidligere to-nivå-systemet «Default tier / Enterprise tier» er erstattet av **Quota Tiers** — Free Tier (Tier 0) pluss Tier 1–6 (Tier 6 høyest), med kvote som øker automatisk med forbruk. TPM/RPM defineres per region, per subscription og per modell/deployment-type. Eksempel GlobalStandard TPM (Tier 1 → Tier 6): gpt-4.1 1M → 45M; gpt-4o-mini 2M → 225M; o1 3M → 48M; o3-mini 5M → 80M. Maks TPM (Tier 6) = 225M. Se [quotas-limits](https://learn.microsoft.com/azure/foundry/openai/quotas-limits) for full per-tier-tabell.
|
||||
|
||||
**Viktig:**
|
||||
TPM (Tokens Per Minute) = Max tokens som kan prosesseres per minutt på deployment-nivå. Hvis du sender én request med 50k input tokens + 2k output tokens = 52k tokens → teller mot TPM.
|
||||
|
|
@ -319,9 +321,9 @@ Hvis du har 10,000 queries per måned: **11,300 NOK/måned** (kun LLM-kostnad, i
|
|||
3. **Batch processing** for ikke-interaktive workloads (Azure OpenAI Batch API: 50% rabatt)
|
||||
4. **Monitorering**: Bruk Azure Monitor for å spore token usage per deployment
|
||||
|
||||
**Verified (Azure OpenAI Batch Quota):**
|
||||
- gpt-4.1: 500M tokens per month (Enterprise tier), 30M (Default tier)
|
||||
- gpt-4o: 500M (Enterprise), 30M (Default)
|
||||
**Batch-kvote (Azure OpenAI — nå per Quota Tier; tidligere «Default/Enterprise»):**
|
||||
- gpt-4.1: ~500M tokens/måned (øvre tier), ~30M (lavere tier) — ikke re-verifisert mot gjeldende per-tier-tabell, se quotas-limits
|
||||
- gpt-4o: ~500M (øvre), ~30M (lavere) — samme forbehold
|
||||
|
||||
---
|
||||
|
||||
|
|
|
|||
Loading…
Add table
Add a link
Reference in a new issue