fix(ms-ai-architect): Spor 0 — 37 kilde-verifiserte KB-feil fikset (25 ref-filer), 1 avvist [skip-docs]
Per-kilde verifiserings-agenter (Opus xhigh, live microsoft_docs_fetch) bekreftet hver verdi mot kilden FOER endring; alle forekomster av samme gale fakta fikset fil-vidt (ikke bare sitert linje). - 37/38 confirm-fix anvendt; #8 (model-selection «Model Router GA») AVVIST: fila var allerede korrekt (Model Router GA siden 2025-11-18); den siterte model-choice-guide har utdatert «(preview)»-etikett. AA «fikse» ville innfoert en feil. - Tverteklynger reconciled til kilde-sann verdi: AI Search storage (S1 160/S2 512/S3 1024/L1 2048/L2 4096 GB; vektor 5/35/150/300), Quota Tiers (erstatter Default/Enterprise + «1 Unit Capacity»). - Hoey-innsats: realtime Schrems II omskrevet (global deployment != EU-residens, selv-verifisert mot kilde); Data Zone Norway East = gpt-5.4 OG gpt-5.5 (ikke kun 5.5); computer-use = gpt-5.4 + computer-tool (region flagget for verifisering). - Suite 552/552 groenn. Manifest oppdatert (fixed/verdict/verified per fiks). Spor 1-froe (cross-fil-gjentakelser i UBEROERTE filer): «DDoS Protection Standard» i ros-ai-threat-library.md + zero-trust-ai-services.md. Tilstoetende funn (ikke i de 38): se docs / STATE.
This commit is contained in:
parent
2b6fb62f53
commit
2c54f0d5a0
26 changed files with 327 additions and 207 deletions
|
|
@ -10,7 +10,7 @@
|
|||
|
||||
Moderne AI-løsninger krever ofte forskjellige modellkapabiliteter for ulike oppgaver. En multi-model strategy innebærer intelligent routing av requests til den mest kostnadseffektive modellen som tilfredsstiller kvalitetskravene. Med Azure OpenAI-modeller som varierer fra GPT-4.1-nano (59 400 tokens/PTU) til GPT-5 (4 750 tokens/PTU) kan besparelsene være betydelige — opptil 90% kostnadsdifferanse mellom modeller for enkle oppgaver.
|
||||
|
||||
Model Router fra Microsoft er en trent språkmodell som automatiserer denne beslutningsprosessen i real-time. Den analyserer prompt-kompleksitet, resonnementskrav og oppgavetype for å velge optimal modell fra et sett på opptil 18 underliggende modeller (inkludert GPT-serien, Claude, DeepSeek, Llama og Grok). Dette gir én deployment-overflate med kombinert kosteffektivitet og kvalitet.
|
||||
Model Router fra Microsoft er en trent språkmodell som automatiserer denne beslutningsprosessen i real-time. Den analyserer prompt-kompleksitet, resonnementskrav og oppgavetype for å velge optimal modell fra et sett på 28 underliggende modeller (inkludert GPT-serien, Claude, DeepSeek, Llama, Grok og flere; versjon 2025-11-18 oppdateres løpende, så antallet vokser). Dette gir én deployment-overflate med kombinert kosteffektivitet og kvalitet.
|
||||
|
||||
For organisasjoner som ønsker mer kontroll, tilbyr custom gateway-løsninger (via Azure API Management eller egen kode) mulighet for egendefinerte routing-regler basert på client identity, quota management, blue-green deployments eller data sovereignty-krav. Denne kunnskapsfilen dekker både managed (Model Router) og custom gateway-strategier for multi-model deployments.
|
||||
|
||||
|
|
@ -24,20 +24,25 @@ For organisasjoner som ønsker mer kontroll, tilbyr custom gateway-løsninger (v
|
|||
| **Routing Modes** | Quality (max nøyaktighet), Balanced (default), Cost (max besparelse) | GA |
|
||||
| **Model Subset** | Custom selection av underliggende modeller for routing | GA |
|
||||
| **Deployment Types** | Global Standard, Data Zone Standard | Regional: East US 2, Sweden Central |
|
||||
| **Underlying Models** | 18 modeller: GPT-4.1/5-serien, o-series, Claude, DeepSeek, Llama, Grok | Varierer per modell |
|
||||
| **Underlying Models** | 28 modeller (per 2026-06): GPT-4.1/5/5.2–5.5-serien, o4-mini, Claude (4–5), DeepSeek (V3.1/V3.2), gpt-oss-120b, Llama-4-Maverick, Grok-4 | Varierer per modell |
|
||||
|
||||
**Underliggende modeller i Model Router `2025-11-18`:**
|
||||
- **OpenAI-modeller:** gpt-4.1, gpt-4.1-mini, gpt-4.1-nano, gpt-5, gpt-5-mini, gpt-5-nano, gpt-5-chat, o4-mini, gpt-4o, gpt-4o-mini
|
||||
- **Reasoning-modeller:** o4-mini (preview)
|
||||
- **3rd-party modeller:** DeepSeek-V3.1, gpt-oss-120b, Llama-4-Maverick-17B-128E-Instruct-FP8, grok-4, grok-4-fast
|
||||
- **Claude (krever egen deployment):** claude-haiku-4-5, claude-opus-4-1, claude-sonnet-4-5
|
||||
**Underliggende modeller i Model Router `2025-11-18` (28 per 2026-06; oppdateres løpende):**
|
||||
- **OpenAI:** gpt-4o, gpt-4o-mini, gpt-4.1, gpt-4.1-mini, gpt-4.1-nano, o4-mini, gpt-5-nano, gpt-5-mini, gpt-5, gpt-5-chat, gpt-5.2, gpt-5.2-chat, gpt-5.3-chat, gpt-5.4-nano, gpt-5.4-mini, gpt-5.4, gpt-5.5
|
||||
- **3rd-party:** DeepSeek-V3.1, DeepSeek-V3.2, gpt-oss-120b, Llama-4-Maverick-17B-128E-Instruct-FP8, grok-4, grok-4-fast-reasoning
|
||||
- **Claude (krever egen deployment):** claude-haiku-4-5, claude-sonnet-4-5, claude-opus-4-1, claude-opus-4-6, claude-opus-4-7
|
||||
|
||||
**Rate limits (Model Router `2025-11-18`):**
|
||||
**Rate limits (Model Router `2025-11-18`, kvotenivå-basert):**
|
||||
|
||||
| Deployment Type | Default RPM | Default TPM | Enterprise RPM | Enterprise TPM |
|
||||
|-----------------|-------------|-------------|----------------|----------------|
|
||||
| GlobalStandard | 250 | 250 000 | 400 | 400 000 |
|
||||
| DataZoneStandard | 150 | 150 000 | 300 | 300 000 |
|
||||
Grenser skalerer med abonnementets bruksnivå (Quota Tier 1–6), ikke lenger Default/Enterprise. Se [Quota tiers](https://learn.microsoft.com/azure/foundry/openai/quotas-limits).
|
||||
|
||||
| Tier | GlobalStandard RPM | GlobalStandard TPM | DataZoneStandard RPM | DataZoneStandard TPM |
|
||||
|------|--------------------|--------------------|----------------------|----------------------|
|
||||
| Tier 1 | 1 000 | 1 000 000 | 300 | 300 000 |
|
||||
| Tier 2 | 2 000 | 2 000 000 | 670 | 670 000 |
|
||||
| Tier 3 | 4 000 | 4 000 000 | 1 000 | 1 000 000 |
|
||||
| Tier 4 | 7 000 | 7 000 000 | 2 000 | 2 000 000 |
|
||||
| Tier 5 | 10 000 | 10 000 000 | 3 000 | 3 000 000 |
|
||||
| Tier 6 | 15 000 | 15 000 000 | 4 000 | 4 000 000 |
|
||||
|
||||
### Custom Gateway Architectures
|
||||
|
||||
|
|
|
|||
Loading…
Add table
Add a link
Reference in a new issue