fix(ms-ai-architect): Spor 0 — 37 kilde-verifiserte KB-feil fikset (25 ref-filer), 1 avvist [skip-docs]
Per-kilde verifiserings-agenter (Opus xhigh, live microsoft_docs_fetch) bekreftet hver verdi mot kilden FOER endring; alle forekomster av samme gale fakta fikset fil-vidt (ikke bare sitert linje). - 37/38 confirm-fix anvendt; #8 (model-selection «Model Router GA») AVVIST: fila var allerede korrekt (Model Router GA siden 2025-11-18); den siterte model-choice-guide har utdatert «(preview)»-etikett. AA «fikse» ville innfoert en feil. - Tverteklynger reconciled til kilde-sann verdi: AI Search storage (S1 160/S2 512/S3 1024/L1 2048/L2 4096 GB; vektor 5/35/150/300), Quota Tiers (erstatter Default/Enterprise + «1 Unit Capacity»). - Hoey-innsats: realtime Schrems II omskrevet (global deployment != EU-residens, selv-verifisert mot kilde); Data Zone Norway East = gpt-5.4 OG gpt-5.5 (ikke kun 5.5); computer-use = gpt-5.4 + computer-tool (region flagget for verifisering). - Suite 552/552 groenn. Manifest oppdatert (fixed/verdict/verified per fiks). Spor 1-froe (cross-fil-gjentakelser i UBEROERTE filer): «DDoS Protection Standard» i ros-ai-threat-library.md + zero-trust-ai-services.md. Tilstoetende funn (ikke i de 38): se docs / STATE.
This commit is contained in:
parent
2b6fb62f53
commit
2c54f0d5a0
26 changed files with 327 additions and 207 deletions
|
|
@ -22,7 +22,7 @@ Quotas er tekniske grenser som kontrollerer hvor mye av en gitt ressurs en subsc
|
|||
|
||||
| Quota Type | Scope | Default Limit | Adjustable? |
|
||||
|------------|-------|---------------|-------------|
|
||||
| **Model Quota (TPM)** | Per subscription, per region, per model | Varies by tier (150K-30M TPM) | Yes, via quota request |
|
||||
| **Model Quota (TPM)** | Per subscription, per region, per model | Varierer per Quota Tier (Free Tier (Tier 0) + Tier 1–6); ca. 100K–225M TPM | Yes, via quota request |
|
||||
| **VM Family Quota** | Per subscription, per region | 24-300 cores (depends on subscription type) | Yes, via support request |
|
||||
| **Compute Instances** | Per region | 500 total compute limit | Yes, up to 2500 via quota UI, beyond via support |
|
||||
| **Serverless API Quota** | Per deployment | 200K TPM, 1K RPM | Yes, one deployment per model per project by default |
|
||||
|
|
|
|||
|
|
@ -299,7 +299,7 @@ Månedlig besparelse (NOK) = (Kostnad_current - Kostnad_new) × USD_to_NOK
|
|||
### Power Platform AI Builder
|
||||
|
||||
**Modellvalg i AI Builder:**
|
||||
- AI Builder bruker **Azure OpenAI GPT-4o-mini** som default for generative oppgaver (per desember 2024)
|
||||
- AI Builder / prompt builder bruker **GPT-4.1 mini** som standardmodell for generative oppgaver (GPT-4o mini og GPT-4o brukes nå kun i US government-regioner)
|
||||
- Ingen direkte modellvalg tilgjengelig i AI Builder-grensesnittet
|
||||
- Kostnader inkludert i AI Builder credits (500 credits/bruker/måned i premium-planer)
|
||||
|
||||
|
|
|
|||
|
|
@ -10,7 +10,7 @@
|
|||
|
||||
Moderne AI-løsninger krever ofte forskjellige modellkapabiliteter for ulike oppgaver. En multi-model strategy innebærer intelligent routing av requests til den mest kostnadseffektive modellen som tilfredsstiller kvalitetskravene. Med Azure OpenAI-modeller som varierer fra GPT-4.1-nano (59 400 tokens/PTU) til GPT-5 (4 750 tokens/PTU) kan besparelsene være betydelige — opptil 90% kostnadsdifferanse mellom modeller for enkle oppgaver.
|
||||
|
||||
Model Router fra Microsoft er en trent språkmodell som automatiserer denne beslutningsprosessen i real-time. Den analyserer prompt-kompleksitet, resonnementskrav og oppgavetype for å velge optimal modell fra et sett på opptil 18 underliggende modeller (inkludert GPT-serien, Claude, DeepSeek, Llama og Grok). Dette gir én deployment-overflate med kombinert kosteffektivitet og kvalitet.
|
||||
Model Router fra Microsoft er en trent språkmodell som automatiserer denne beslutningsprosessen i real-time. Den analyserer prompt-kompleksitet, resonnementskrav og oppgavetype for å velge optimal modell fra et sett på 28 underliggende modeller (inkludert GPT-serien, Claude, DeepSeek, Llama, Grok og flere; versjon 2025-11-18 oppdateres løpende, så antallet vokser). Dette gir én deployment-overflate med kombinert kosteffektivitet og kvalitet.
|
||||
|
||||
For organisasjoner som ønsker mer kontroll, tilbyr custom gateway-løsninger (via Azure API Management eller egen kode) mulighet for egendefinerte routing-regler basert på client identity, quota management, blue-green deployments eller data sovereignty-krav. Denne kunnskapsfilen dekker både managed (Model Router) og custom gateway-strategier for multi-model deployments.
|
||||
|
||||
|
|
@ -24,20 +24,25 @@ For organisasjoner som ønsker mer kontroll, tilbyr custom gateway-løsninger (v
|
|||
| **Routing Modes** | Quality (max nøyaktighet), Balanced (default), Cost (max besparelse) | GA |
|
||||
| **Model Subset** | Custom selection av underliggende modeller for routing | GA |
|
||||
| **Deployment Types** | Global Standard, Data Zone Standard | Regional: East US 2, Sweden Central |
|
||||
| **Underlying Models** | 18 modeller: GPT-4.1/5-serien, o-series, Claude, DeepSeek, Llama, Grok | Varierer per modell |
|
||||
| **Underlying Models** | 28 modeller (per 2026-06): GPT-4.1/5/5.2–5.5-serien, o4-mini, Claude (4–5), DeepSeek (V3.1/V3.2), gpt-oss-120b, Llama-4-Maverick, Grok-4 | Varierer per modell |
|
||||
|
||||
**Underliggende modeller i Model Router `2025-11-18`:**
|
||||
- **OpenAI-modeller:** gpt-4.1, gpt-4.1-mini, gpt-4.1-nano, gpt-5, gpt-5-mini, gpt-5-nano, gpt-5-chat, o4-mini, gpt-4o, gpt-4o-mini
|
||||
- **Reasoning-modeller:** o4-mini (preview)
|
||||
- **3rd-party modeller:** DeepSeek-V3.1, gpt-oss-120b, Llama-4-Maverick-17B-128E-Instruct-FP8, grok-4, grok-4-fast
|
||||
- **Claude (krever egen deployment):** claude-haiku-4-5, claude-opus-4-1, claude-sonnet-4-5
|
||||
**Underliggende modeller i Model Router `2025-11-18` (28 per 2026-06; oppdateres løpende):**
|
||||
- **OpenAI:** gpt-4o, gpt-4o-mini, gpt-4.1, gpt-4.1-mini, gpt-4.1-nano, o4-mini, gpt-5-nano, gpt-5-mini, gpt-5, gpt-5-chat, gpt-5.2, gpt-5.2-chat, gpt-5.3-chat, gpt-5.4-nano, gpt-5.4-mini, gpt-5.4, gpt-5.5
|
||||
- **3rd-party:** DeepSeek-V3.1, DeepSeek-V3.2, gpt-oss-120b, Llama-4-Maverick-17B-128E-Instruct-FP8, grok-4, grok-4-fast-reasoning
|
||||
- **Claude (krever egen deployment):** claude-haiku-4-5, claude-sonnet-4-5, claude-opus-4-1, claude-opus-4-6, claude-opus-4-7
|
||||
|
||||
**Rate limits (Model Router `2025-11-18`):**
|
||||
**Rate limits (Model Router `2025-11-18`, kvotenivå-basert):**
|
||||
|
||||
| Deployment Type | Default RPM | Default TPM | Enterprise RPM | Enterprise TPM |
|
||||
|-----------------|-------------|-------------|----------------|----------------|
|
||||
| GlobalStandard | 250 | 250 000 | 400 | 400 000 |
|
||||
| DataZoneStandard | 150 | 150 000 | 300 | 300 000 |
|
||||
Grenser skalerer med abonnementets bruksnivå (Quota Tier 1–6), ikke lenger Default/Enterprise. Se [Quota tiers](https://learn.microsoft.com/azure/foundry/openai/quotas-limits).
|
||||
|
||||
| Tier | GlobalStandard RPM | GlobalStandard TPM | DataZoneStandard RPM | DataZoneStandard TPM |
|
||||
|------|--------------------|--------------------|----------------------|----------------------|
|
||||
| Tier 1 | 1 000 | 1 000 000 | 300 | 300 000 |
|
||||
| Tier 2 | 2 000 | 2 000 000 | 670 | 670 000 |
|
||||
| Tier 3 | 4 000 | 4 000 000 | 1 000 | 1 000 000 |
|
||||
| Tier 4 | 7 000 | 7 000 000 | 2 000 | 2 000 000 |
|
||||
| Tier 5 | 10 000 | 10 000 000 | 3 000 | 3 000 000 |
|
||||
| Tier 6 | 15 000 | 15 000 000 | 4 000 | 4 000 000 |
|
||||
|
||||
### Custom Gateway Architectures
|
||||
|
||||
|
|
|
|||
|
|
@ -46,10 +46,10 @@ Basert på Microsoft Learn-data for standard konfigurasjon (5 retrieved document
|
|||
|
||||
| Tier | Partitions | Replicas | QPS Capacity | Storage | ~NOK/month | Best For |
|
||||
|------|------------|----------|--------------|---------|------------|----------|
|
||||
| **Basic** | 1 | 3 | Moderate | 2 GB | 1 200 | Proof-of-concept, lav trafikk |
|
||||
| **S1** | 12 | 12 | High | 25 GB/partition | 2 800 | Produksjon, moderate volumer |
|
||||
| **S2** | 12 | 12 | Very High | 100 GB/partition | 11 200 | High-volume produksjon |
|
||||
| **S3** | 12 | 12 | Enterprise | 200 GB/partition | 22 400 | Enterprise-skala |
|
||||
| **Basic** | 1 | 3 | Moderate | 15 GB/partition (eldre: 2 GB) | 1 200 | Proof-of-concept, lav trafikk |
|
||||
| **S1** | 12 | 12 | High | 160 GB/partition | 2 800 | Produksjon, moderate volumer |
|
||||
| **S2** | 12 | 12 | Very High | 512 GB/partition | 11 200 | High-volume produksjon |
|
||||
| **S3** | 12 | 12 | Enterprise | 1 024 GB/partition | 22 400 | Enterprise-skala |
|
||||
|
||||
**Baseline (Modellkunnskap):** Prisene er omregnet fra USD til NOK (1 USD ≈ 11 NOK, februar 2026) og er veiledende.
|
||||
|
||||
|
|
|
|||
|
|
@ -282,7 +282,7 @@ Er tjenesten Azure OpenAI/Foundry Models?
|
|||
|
||||
**💡 Best Practice:** **ALLTID deploy først, kjøp reservasjon etterpå.** Quota ≠ capacity.
|
||||
|
||||
**Autorenew er nå ON som standard for alle nye reservasjoner** (gjelder reservasjoner opprettet etter 2025-Q4). Sjekk innstillingen ved kjøp og deaktiver manuelt hvis ønskelig. Verified (MCP 2026-04).
|
||||
**Autorenew er opt-in — ikke på som standard.** Aktiveres i Renewal settings eller ved kjøp. Ved utløp kan reservasjonen enten fornyes på samme reservasjons-ordre-ID eller erstattes av en ny reservasjon; en erstatningsreservasjon har autorenew **av** som standard. Sjekk og still inn ønsket fornyelse ved kjøp/fornyelse. Verified (MCP 2026-06).
|
||||
|
||||
---
|
||||
|
||||
|
|
|
|||
|
|
@ -396,10 +396,10 @@ Eksempel: 5 millioner dokumenter, gjennomsnittlig 2000 tokens per dokument
|
|||
|
||||
| Tier | Vector quota | Pris/måned (1 partition) | Egnet datasett |
|
||||
|------|--------------|--------------------------|----------------|
|
||||
| **Basic** | 1 GB | ~$75 USD | <100K docs |
|
||||
| **S1** | 12 GB | ~$250 USD | 100K-1M docs |
|
||||
| **S2** | 36 GB | ~$1,000 USD | 1M-5M docs |
|
||||
| **S3** | 72 GB | ~$2,000 USD | 5M-20M docs |
|
||||
| **Basic** | 5 GB | ~$75 USD | <100K docs |
|
||||
| **S1** | 35 GB | ~$250 USD | 100K-1M docs |
|
||||
| **S2** | 150 GB | ~$1,000 USD | 1M-5M docs |
|
||||
| **S3** | 300 GB | ~$2,000 USD | 5M-20M docs |
|
||||
|
||||
**Viktig:** Eldre services (pre-April 2024) har lavere quotas. Sjekk oppgraderingsmulighet: `az search service show --name <service> --resource-group <rg>`.
|
||||
|
||||
|
|
|
|||
Loading…
Add table
Add a link
Reference in a new issue