feat(ultraplan-local): v1.6.0 — /ultraresearch-local deep research command
Add /ultraresearch-local for structured research combining local codebase analysis with external knowledge via parallel agent swarms. Produces research briefs with triangulation, confidence ratings, and source quality assessment. New command: /ultraresearch-local with modes --quick, --local, --external, --fg. New agents: research-orchestrator (opus), docs-researcher, community-researcher, security-researcher, contrarian-researcher, gemini-bridge (all sonnet). New template: research-brief-template.md. Integration: --research flag in /ultraplan-local accepts pre-built research briefs (up to 3), enriches the interview and exploration phases. Planning orchestrator cross-references brief findings during synthesis. Design principle: Context Engineering — right information to right agent at right time. Research briefs are structured artifacts in the pipeline: ultraresearch → brief → ultraplan --research → plan → ultraexecute. Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>
This commit is contained in:
commit
baa2d0220b
488 changed files with 213221 additions and 0 deletions
405
skills/ms-ai-advisor/references/platforms/model-catalog-2026.md
Normal file
405
skills/ms-ai-advisor/references/platforms/model-catalog-2026.md
Normal file
|
|
@ -0,0 +1,405 @@
|
|||
# Azure AI Modellkatalog 2026 — Oversikt og valgveiledning
|
||||
|
||||
**Last updated:** 2026-02 (research via microsoft-learn MCP)
|
||||
**Status:** Aktiv — dekker alle modeller tilgjengelig i Microsoft Foundry per 2026-02
|
||||
|
||||
---
|
||||
|
||||
## Oversikt
|
||||
|
||||
Microsoft Foundry (tidligere Azure AI Foundry) har per 2026-02:
|
||||
- **1 900+** frontier-modeller solgt direkte av Azure
|
||||
- **11 000+** totalt i katalogen (inkl. partner og community)
|
||||
- **40+** Azure-regioner
|
||||
|
||||
Modellkatalogen er delt i to kategorier:
|
||||
1. **Foundry Models sold directly by Azure (azure-openai)** — OpenAI-serien (GPT-5, GPT-4.1, o-serien)
|
||||
2. **Foundry Models sold directly by Azure (azure-direct-others)** — DeepSeek, Meta, Mistral, xAI, Cohere mfl.
|
||||
|
||||
---
|
||||
|
||||
## 1. GPT-5-serien (GA august 2025)
|
||||
|
||||
OpenAIs flaggskip reasoning-modeller. Alle versjonene støtter Chat Completions API, Responses API, structured outputs, text/image input og parallel tool calling.
|
||||
|
||||
**Tilgangsmodell:**
|
||||
- `gpt-5`, `gpt-5-codex`, `gpt-5-pro` — krever registrering: `https://aka.ms/oai/gpt5access`
|
||||
- `gpt-5-mini`, `gpt-5-nano`, `gpt-5-chat` — åpen tilgang, ingen registrering
|
||||
|
||||
| Modell | GA-dato | Kontekstvindu | Max output | Merknad |
|
||||
|--------|---------|---------------|------------|---------|
|
||||
| `gpt-5` | 2025-08-07 | 400K (input 272K, output 128K) | 128K | Flagship, sterkest reasoning. PTU: 4 750 input TPM/PTU |
|
||||
| `gpt-5-mini` | 2025-08-07 | 400K (input 272K, output 128K) | 128K | Kostnadsoptimalisert. PTU: 23 750 input TPM/PTU |
|
||||
| `gpt-5-nano` | 2025-08-07 | 400K (input 272K, output 128K) | 128K | On-device/edge, lavest pris |
|
||||
| `gpt-5-chat` | 2025-08-07 (Preview) | 128K | 16 384 | Conversation-optimalisert, emosjonell intelligens |
|
||||
| `gpt-5-codex` | 2025-09-11 | 400K (input 272K, output 128K) | 128K | Kodeoptimalisert (Codex CLI/VS Code) |
|
||||
| `gpt-5-pro` | 2025-10-06 | 400K (input 272K, output 128K) | 128K | Høyeste kapabilitet |
|
||||
| `gpt-5.1` | 2025-11-13 | 400K (input 272K, output 128K) | 128K | Neste generasjon |
|
||||
| `gpt-5.2` | 2025-12-11 | 400K | 128K | Siste versjon |
|
||||
|
||||
**PTU-ratio for GPT-5:** 1 output token teller som 8 input tokens mot utnyttelsesgrensen.
|
||||
|
||||
**Styrker:**
|
||||
- Dyp reasoning og multi-step logikk
|
||||
- Bedre enn GPT-4.1 på komplekse oppgaver, vitenskap, koding og matematikk
|
||||
- Høyere latens enn GPT-4.1 (pga. dypere resonneringsprosess)
|
||||
|
||||
---
|
||||
|
||||
## 2. GPT-4.1-serien (GA april 2025)
|
||||
|
||||
Optimalisert for høy hastighet, høy throughput og enterprise-skalering. Ingen reasoning-overhead — rask og forutsigbar.
|
||||
|
||||
| Modell | GA-dato | Kontekstvindu | Max output | Merknad |
|
||||
|--------|---------|---------------|------------|---------|
|
||||
| `gpt-4.1` | 2025-04-14 | 1 047 576 (standard), 128K (PTU), 300K (batch) | 32 768 | Lengst kontekst, 4:1 input/output PTU-ratio |
|
||||
| `gpt-4.1-mini` | 2025-04-14 | 1 047 576 | 32 768 | Balansert pris/ytelse |
|
||||
| `gpt-4.1-nano` | 2025-04-14 | 1 047 576 | 32 768 | Lavest pris, 59 400 input TPM/PTU |
|
||||
|
||||
**PTU-ratio for GPT-4.1:** 1 output token teller som 4 input tokens.
|
||||
|
||||
**Styrker:**
|
||||
- Ekstremt lang kontekst (1M tokens)
|
||||
- Lav latens, høy throughput
|
||||
- Ideell for real-time chat, kundesupport, høyvolum summarisering
|
||||
- Code og instruction following — bedre enn GPT-4o
|
||||
|
||||
**Sammenligning GPT-5 vs GPT-4.1:**
|
||||
|
||||
| Dimensjon | GPT-5 | GPT-4.1 |
|
||||
|-----------|-------|---------|
|
||||
| Modelltype | Reasoning | Non-reasoning, rask |
|
||||
| Best for | Kompleks reasoning, flersteg logikk | Real-time chat, faktaspørsmål, høyvolum |
|
||||
| Latens | Høyere | Lavere |
|
||||
| Throughput | Moderat | Høy |
|
||||
| Kontekst | 272K input, 128K output | Opp til 1M tokens |
|
||||
|
||||
---
|
||||
|
||||
## 3. o-serien — Reasoning Models
|
||||
|
||||
Spesialiserte reasoning-modeller som bruker mer tid på å forstå brukerens forespørsel. Sterkest på vitenskap, koding og matematikk.
|
||||
|
||||
| Modell | GA-dato | Kontekstvindu | Max output | Merknad |
|
||||
|--------|---------|---------------|------------|---------|
|
||||
| `o4-mini` | 2025-04-16 | 200K input | 100K output | Kostnadseffektiv reasoning, image-støtte. PTU: 5 400 input TPM/PTU |
|
||||
| `o3` | 2025-04-16 | 200K input | 100K output | Sterk reasoning + image. PTU: 3 000 input TPM/PTU |
|
||||
| `o3-pro` | 2025-06-10 | 200K input | 100K output | Maksimal reasoning, anbefales background mode |
|
||||
| `o3-mini` | 2025-01-31 | 200K input | 100K output | Text-only, raskere enn o3 |
|
||||
| `o1` | 2024-12-17 | 200K input | 100K output | Etablert reasoning + image |
|
||||
| `codex-mini` | 2025-05-16 | 200K input | 100K output | Fine-tunet o4-mini for koding |
|
||||
|
||||
**API-karakteristikker:**
|
||||
- Bruker `max_completion_tokens` (Chat Completions API) eller `max_output_tokens` (Responses API)
|
||||
- Støtter IKKE `temperature`, `top_p`, `presence_penalty`, `frequency_penalty`
|
||||
- Streaming for `o3` er begrenset tilgang
|
||||
|
||||
---
|
||||
|
||||
## 4. DeepSeek-modeller
|
||||
|
||||
Open source-modeller tilgjengelig som "Foundry Models sold directly by Azure". Alle støtter Global Standard deployment i alle regioner.
|
||||
|
||||
| Modell | Type | Kontekst | Tool calling | Merknad |
|
||||
|--------|------|----------|-------------|---------|
|
||||
| `DeepSeek-R1` | Reasoning | 163 840 tokens | Nei | Sterk på reasoning + koding |
|
||||
| `DeepSeek-R1-0528` | Reasoning | 163 840 tokens | Nei | Oppdatert versjon |
|
||||
| `DeepSeek-V3-0324` | MoE chat | 131 072 tokens | Ja | Mixture-of-Experts |
|
||||
| `DeepSeek-V3.1` | MoE chat | 131 072 tokens | Ja | Oppdatert MoE |
|
||||
| `DeepSeek-V3.2` | MoE reasoning | 128 000 tokens | Nei | Nyeste versjon |
|
||||
| `MAI-DS-R1` | Reasoning | 163 840 tokens | Nei | Microsofts variant av DeepSeek-R1 |
|
||||
|
||||
**PTU for DeepSeek:** 4 000 input TPM/PTU (DeepSeek-R1, V3-0324, R1-0528).
|
||||
|
||||
**Norway East:** Alle DeepSeek-modeller er tilgjengelig i Norway East via Global Standard deployment.
|
||||
|
||||
**Viktig:** DeepSeek-R1 støtter ikke tool calling — bytt til V3-0324 eller V3.1 hvis tool use trengs.
|
||||
|
||||
---
|
||||
|
||||
## 5. Phi-serien (Small Language Models)
|
||||
|
||||
Microsofts egne SLM-er (Small Language Models), optimalisert for effektiv inferens med begrenset ressursbruk.
|
||||
|
||||
| Modell | Kontekst | Modalitet | Tool calling | Merknad |
|
||||
|--------|----------|-----------|-------------|---------|
|
||||
| `Phi-4` | 16 384 tokens | Text | Nei | Generell SLM, bred språkdekning (46 språk) |
|
||||
| `Phi-4-mini-instruct` | 131 072 tokens | Text | Nei | Liten og rask, brukt i MS Edge |
|
||||
| `Phi-4-multimodal-instruct` | 131 072 tokens | Text + bilde + lyd | Nei | Multimodal SLM |
|
||||
| `Phi-4-reasoning` | 32 768 tokens | Text | Nei | Reasoning-variant |
|
||||
| `Phi-4-mini-reasoning` | 128 000 tokens | Text | Nei | Kompakt reasoning |
|
||||
|
||||
**Bruksscenarioer:**
|
||||
- On-device / Foundry Local inference (Phi-4-mini-instruct er optimalisert for ONNX)
|
||||
- Lav kostnad, høy throughput
|
||||
- Edge og offline-scenarioer
|
||||
- Ikke egnet for komplekse multi-step reasoning
|
||||
|
||||
---
|
||||
|
||||
## 6. Andre bemerkelsesverdige modeller
|
||||
|
||||
### Meta Llama
|
||||
|
||||
| Modell | Kontekst | Merknad |
|
||||
|--------|----------|---------|
|
||||
| `Llama-4-Maverick-17B-128E-Instruct-FP8` | 1M tokens | Multimodal (text + bilde), 17B aktive parametere (128 eksperter MoE) |
|
||||
| `Llama-3.3-70B-Instruct` | 128 000 tokens (output: 8 192) | Solid general-purpose, åpen kildekode. PTU: 8 450 input TPM/PTU |
|
||||
|
||||
### Mistral
|
||||
|
||||
| Modell | Type | Merknad |
|
||||
|--------|------|---------|
|
||||
| `Mistral-Large-3` | Chat (text + bilde) | Tool calling støttet, kun West US 3 |
|
||||
| `mistral-document-ai-2505/2512` | Image-to-Text | PDF/bilde til strukturert tekst, alle regioner |
|
||||
|
||||
### Cohere
|
||||
|
||||
| Modell | Merknad |
|
||||
|--------|---------|
|
||||
| `Cohere-command-a` | Sterk på RAG og enterprise-søk |
|
||||
| `Cohere-rerank-v4.0-pro/fast` | Re-ranking for søkepipeliner |
|
||||
| `embed-v-4-0` | Embedding-modell |
|
||||
|
||||
### xAI Grok
|
||||
|
||||
| Modell | Merknad |
|
||||
|--------|---------|
|
||||
| `grok-4` | Frontiermodell, alle regioner inkl. Norway East |
|
||||
| `grok-3`, `grok-3-mini` | Eldre versjon |
|
||||
|
||||
---
|
||||
|
||||
## 7. Modellsammenligningstabell
|
||||
|
||||
| Modell | Kontekst (input) | Max output | PTU: input TPM/PTU | Latency target (99%) | Norway East | Tilgang |
|
||||
|--------|-----------------|------------|---------------------|---------------------|-------------|---------|
|
||||
| `gpt-5` | 272K | 128K | 4 750 | >50 TPS | Via Agent Service | Registrering |
|
||||
| `gpt-5-mini` | 272K | 128K | 23 750 | >80 TPS | Via Agent Service | Åpen |
|
||||
| `gpt-5-nano` | 272K | 128K | Høy | >100 TPS | Via Agent Service | Åpen |
|
||||
| `gpt-4.1` | 1M | 32 768 | 3 000 | >40 TPS | Ja (full) | Åpen |
|
||||
| `gpt-4.1-mini` | 1M | 32 768 | 14 900 | >50 TPS | Ja (full) | Åpen |
|
||||
| `gpt-4.1-nano` | 1M | 32 768 | 59 400 | >60 TPS | Ja (full) | Åpen |
|
||||
| `o4-mini` | 200K | 100K | 5 400 | >66 TPS | Ja (full) | Åpen |
|
||||
| `o3` | 200K | 100K | 3 000 | >40 TPS | Ja (full) | Åpen |
|
||||
| `o3-mini` | 200K | 100K | 2 500 | >66 TPS | Ja (full) | Åpen |
|
||||
| `o1` | 200K | 100K | 230 | >25 TPS | Ja (full) | Åpen |
|
||||
| `DeepSeek-R1` | 163K | 163K | 4 000 | >50 TPS | Ja (Global std) | Åpen |
|
||||
| `DeepSeek-V3-0324` | 131K | 131K | 4 000 | >50 TPS | Ja (Global std) | Åpen |
|
||||
| `Llama-3.3-70B-Instruct` | 128K | 8 192 | 8 450 | >50 TPS | Ja (Global std) | Åpen |
|
||||
| `Phi-4-mini-instruct` | 131K | 4 096 | — | — | Ja | Åpen |
|
||||
| `Phi-4` | 16K | 16K | — | — | Ja | Åpen |
|
||||
|
||||
**Merk:** PTU-tall er fra Microsoft Learn og kan endres. Se [Foundry PTU-kalkulator](https://ai.azure.com/resource/calculator) for oppdaterte tall.
|
||||
|
||||
---
|
||||
|
||||
## 8. Prismodeller
|
||||
|
||||
### Tre hovedmodeller for deployment
|
||||
|
||||
| Deploymenttype | Betaling | Dataresidens | SLA | Egnet for |
|
||||
|----------------|---------|--------------|-----|-----------|
|
||||
| **Global Standard** | Per token (PAYG) | Ingen garanti, data kan rutes globalt | Ja | Testing, variabel last |
|
||||
| **Data Zone Standard** | Per token (PAYG) | Innenfor US eller EU | Ja | GDPR-krav, variabel last |
|
||||
| **Regional Provisioned (PTU)** | Per PTU per time | Garantert til valgt region | Ja | Produksjon, forutsigbar last |
|
||||
|
||||
### Pay-as-you-go (PAYG)
|
||||
|
||||
Token-basert fakturering. Offisiell prising:
|
||||
`https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/`
|
||||
|
||||
**Generelle prisleier (relativ, ikke eksakt):**
|
||||
|
||||
| Prisnivå | Modeller | Merknad |
|
||||
|---------|---------|---------|
|
||||
| Lavest (nano) | `gpt-5-nano`, `gpt-4.1-nano`, `Phi-4-mini` | On-device, enkle oppgaver |
|
||||
| Lav | `gpt-4.1-mini`, `gpt-5-mini`, `o4-mini`, `o3-mini` | Høyvolum, enkle til moderate |
|
||||
| Middels | `gpt-4.1`, `DeepSeek-V3`, `Llama-3.3-70B` | Generelle enterprise-workloads |
|
||||
| Høy | `gpt-5`, `o3`, `o1` | Komplekse reasoning-oppgaver |
|
||||
| Høyest | `gpt-5-pro`, `o3-pro`, `gpt-5.2` | Maksimal kapabilitet |
|
||||
|
||||
### Provisioned Throughput (PTU)
|
||||
|
||||
Garantert kapasitet med forutsigbar latens. Egnet for:
|
||||
- Produksjonsworkloads med stabil trafikk
|
||||
- Latency-sensitive applikasjoner
|
||||
- Høyvolum pipelines der PAYG-variasjon er et problem
|
||||
|
||||
**Viktige PTU-parametere:**
|
||||
- Minimum deployment: 15 PTU (global/data zone) eller 25–50 PTU (regional)
|
||||
- Skaleringsinkrement: 5 PTU (global/data zone) eller 25–50 PTU (regional)
|
||||
- PTU er modell-agnostisk quota — kan brukes til ulike modeller innen regionen
|
||||
- PTU kjøpes time-basert. Azure Reservations gir vesentlig rabatt ved langsiktig bruk
|
||||
|
||||
**Input/output-ratio per modell:**
|
||||
|
||||
| Modell | 1 output token = N input tokens |
|
||||
|--------|--------------------------------|
|
||||
| GPT-5-serien | 8 input tokens |
|
||||
| GPT-4.1-serien | 4 input tokens |
|
||||
| DeepSeek-R1/V3 | 1 (standard, som input) |
|
||||
| Llama-3.3-70B | 4 input tokens (unntak fra standard) |
|
||||
|
||||
### Fine-tuning-kostnader
|
||||
|
||||
Ved bruk av fine-tuned modeller:
|
||||
- **Standard:** PAYG + $1,70/time hosting
|
||||
- **Global Standard:** PAYG + $1,70/time hosting
|
||||
- **PTU:** Per PTU/time (ingen ekstra hosting)
|
||||
- **Developer Tier:** PAYG uten hosting, ingen garanti, slettes etter 24 timer
|
||||
|
||||
---
|
||||
|
||||
## 9. Regional tilgjengelighet
|
||||
|
||||
### Norway East — detaljert status
|
||||
|
||||
**Azure OpenAI-modeller (regional provisioned):**
|
||||
|
||||
| Modell | Norway East |
|
||||
|--------|------------|
|
||||
| `gpt-4.1` (2025-04-14) | Ja |
|
||||
| `gpt-4.1-mini` (2025-04-14) | Ja |
|
||||
| `gpt-4.1-nano` (2025-04-14) | Ja |
|
||||
| `o3` (2025-04-16) | Ja |
|
||||
| `o4-mini` (2025-04-16) | Ja |
|
||||
| `o3-mini` (2025-01-31) | Ja |
|
||||
| `o1` (2024-12-17) | Ja |
|
||||
| `gpt-4o` (2024-08-06) | Ja |
|
||||
| `gpt-4o` (2024-11-20) | Ja |
|
||||
| `gpt-4o-mini` | Ja |
|
||||
| `gpt-5` (2025-08-07) | Via Foundry Agent Service / Global Standard |
|
||||
| `gpt-5-mini` (2025-08-07) | Via Foundry Agent Service / Global Standard |
|
||||
| `gpt-5-nano` (2025-08-07) | Via Global Standard |
|
||||
| `gpt-5.1` (2025-11-13) | Via Foundry Agent Service |
|
||||
| `o3-deep-research` | Ja (ett av kun to regioner globalt) |
|
||||
| `computer-use-preview` | Nei — kun East US 2, Sweden Central, South India |
|
||||
| `sora` (video) | Nei — kun East US 2, Sweden Central |
|
||||
| `gpt-image-1` | Begrenset tilgang, ikke bekreftet Norway East |
|
||||
|
||||
**Foundry Models sold directly by Azure (DeepSeek, Llama, Mistral, Grok):**
|
||||
|
||||
Alle disse er tilgjengelig i Norway East via Global Standard deployment:
|
||||
- DeepSeek-R1, R1-0528, V3-0324, V3.1, V3.2
|
||||
- Llama-4-Maverick, Llama-3.3-70B
|
||||
- Grok-4 (alle varianter)
|
||||
- MAI-DS-R1
|
||||
- mistral-document-ai
|
||||
|
||||
### Sweden Central — referanse
|
||||
|
||||
Sweden Central har full feature coverage og er anbefalt for pilot-prosjekter med nyeste features:
|
||||
- GPT-5-serien (alle varianter inkl. gpt-5-mini, nano)
|
||||
- Alle GPT-4.1-varianter
|
||||
- o-serien (o3, o4-mini, o3-mini, o1, o3-pro)
|
||||
- Computer-Use (`computer-use-preview`) — JA
|
||||
- Sora video generation — JA
|
||||
- DeepSeek, Grok, Llama, Mistral — alle tilgjengelig
|
||||
- Foundry Agent Service (GA), Workflows, Deep Research
|
||||
|
||||
### West Europe
|
||||
|
||||
Full dekning av GPT-5, GPT-4.1, o-serien, DeepSeek-modeller og alle Foundry Models sold directly by Azure.
|
||||
|
||||
### Oppsummering: Nordiske regioner
|
||||
|
||||
| Feature | Norway East | Sweden Central | West Europe |
|
||||
|---------|------------|----------------|-------------|
|
||||
| GPT-4.1-serien | Ja | Ja | Ja |
|
||||
| GPT-5 (regional PTU) | Via Global std/Agent Service | Ja | Ja |
|
||||
| o3, o4-mini | Ja | Ja | Ja |
|
||||
| DeepSeek (alle) | Ja | Ja | Ja |
|
||||
| Llama 3.3-70B | Ja | Ja | Ja |
|
||||
| Computer-Use | Nei | Ja | Nei |
|
||||
| Sora | Nei | Ja | Nei |
|
||||
| o3-deep-research | Ja | Nei | Ja |
|
||||
| Dataresidens (GDPR) | Norsk | Svensk | Europeisk |
|
||||
|
||||
---
|
||||
|
||||
## 10. For Cosmo: Modellvalgveiledning
|
||||
|
||||
### Beslutningsflyt
|
||||
|
||||
```
|
||||
Er oppgaven enkel (chat, Q&A, summarisering)?
|
||||
├── Ja, høyvolum og kostnad er kritisk → gpt-4.1-nano / gpt-5-nano
|
||||
├── Ja, balansert → gpt-4.1-mini / gpt-5-mini / o4-mini
|
||||
└── Nei, kompleks
|
||||
|
||||
Er oppgaven kompleks (reasoning, kode, analyse)?
|
||||
├── Trenger dyp reasoning + tid til svaret → gpt-5 / o3 / o3-pro
|
||||
├── Rask reasoning + bilde-input → o4-mini
|
||||
└── Kode-spesifikk → gpt-5-codex / codex-mini
|
||||
|
||||
Har kunden Norway East-krav (dataresidens)?
|
||||
├── Ja → GPT-4.1-serien, o3, o4-mini (full støtte)
|
||||
│ DeepSeek (Global Standard — data kan rutes globalt, vurder nøye)
|
||||
│ GPT-5 → kun via Global Standard/Agent Service (data kan forlate Norway East)
|
||||
└── Nei → vurder Sweden Central for full feature coverage
|
||||
|
||||
Er kunden offentlig sektor (Schrems II / GDPR)?
|
||||
├── Ja, strenge krav → Regional Provisioned i Norway East
|
||||
│ Velg: gpt-4.1, o3, o4-mini — bekreftet regional PTU
|
||||
│ Unngå: Global Standard deployment (data rutes globalt)
|
||||
└── Nei → Global Standard er akseptabelt
|
||||
|
||||
Trenger kunden open-source/selvhostet-alternativ?
|
||||
├── Ja, reasoning → DeepSeek-R1 / MAI-DS-R1
|
||||
├── Ja, chat + tool use → DeepSeek-V3-0324 / Llama-3.3-70B
|
||||
└── Ja, liten modell (edge/on-device) → Phi-4-mini-instruct / Foundry Local
|
||||
```
|
||||
|
||||
### Hurtigguide per scenario
|
||||
|
||||
| Scenario | Anbefalt modell | Begrunnelse |
|
||||
|---------|----------------|-------------|
|
||||
| Intern chatbot, Teams | gpt-4.1-mini | Raskt, billig, godt nok |
|
||||
| RAG over store dokumenter | gpt-4.1 (1M kontekst) eller gpt-5 | Lang kontekst, god instruction following |
|
||||
| Juridisk/medisinsk analyse | gpt-5 eller o3 | Dyp reasoning, nøyaktighet |
|
||||
| Kodegjennomgang / copilot | gpt-5-codex / gpt-4.1 | Kodeoptimalisert |
|
||||
| Kostnadseffektiv høyvolum | gpt-4.1-nano / gpt-5-nano | Lavest pris, høy throughput |
|
||||
| Multi-agent orkestrering | gpt-5 / gpt-4.1 (som orkestratormodell) | Sterk instruction following |
|
||||
| On-device / edge / offline | Phi-4-mini-instruct (Foundry Local) | Kjører lokalt, ingen sky |
|
||||
| Open-source med reasoning | DeepSeek-R1 / MAI-DS-R1 | Åpen kildekode, sterk reasoning |
|
||||
| Sammenligning av alternativer | Model Router | Automatisk routing, opp til 60% kostnadsbesparelse |
|
||||
| DPIA-kritisk (data forblir i Norge) | gpt-4.1/o3 + Regional PTU Norway East | Garantert dataresidens |
|
||||
|
||||
### Spørsmål å stille kunden
|
||||
|
||||
1. "Hva er primæroppgaven — chat/søk, analyse, koding eller kreativt innhold?"
|
||||
2. "Hvilke volumforventninger har dere (tokens/måned)?"
|
||||
3. "Er dataresidens et krav, eller er Global Standard akseptabelt?"
|
||||
4. "Trenger dere open-source/selvhostet alternativ av compliance-hensyn?"
|
||||
5. "Er latens kritisk (real-time UI) eller kan modellen tenke seg om (batch/agent)?"
|
||||
6. "Skal modellen kjøre på edge/on-device?"
|
||||
|
||||
### Norway East-spesifikke råd
|
||||
|
||||
- **Bruk Regional PTU** for produksjonskritiske workloads med dataresidensbehov
|
||||
- **gpt-4.1-serien** er primærvalget — full regional PTU, lav latens
|
||||
- **o3 og o4-mini** er tilgjengelig med regional PTU i Norway East
|
||||
- **GPT-5** er tilgjengelig via Foundry Agent Service og Global Standard, men data kan rutes utenfor Norway East — vurder nøye for sensitive data
|
||||
- **Deep Research** (`o3-deep-research`) er tilgjengelig i Norway East — ett av kun to regioner globalt
|
||||
- **DeepSeek** bruker Global Standard (alle regioner) — ikke egnet for strenge dataresidens-krav
|
||||
|
||||
---
|
||||
|
||||
## Kilder og verifisering
|
||||
|
||||
Adapted from Microsoft Learn documentation ([CC BY 4.0](https://creativecommons.org/licenses/by/4.0/)):
|
||||
|
||||
- [Foundry Models sold directly by Azure (azure-openai)](https://learn.microsoft.com/azure/ai-foundry/foundry-models/concepts/models-sold-directly-by-azure?view=foundry-classic)
|
||||
- [Foundry Models sold directly by Azure (azure-direct-others)](https://learn.microsoft.com/azure/ai-foundry/foundry-models/concepts/models-sold-directly-by-azure?view=foundry-classic&pivots=azure-direct-others)
|
||||
- [Azure OpenAI in Azure AI Foundry Models — model overview](https://learn.microsoft.com/azure/ai-foundry/openai/concepts/models)
|
||||
- [GPT-5 vs GPT-4.1: choosing the right model](https://learn.microsoft.com/azure/ai-foundry/foundry-models/how-to/model-choice-guide?view=foundry-classic)
|
||||
- [Azure OpenAI reasoning models](https://learn.microsoft.com/azure/ai-foundry/openai/how-to/reasoning?view=foundry-classic)
|
||||
- [PTU costs and billing](https://learn.microsoft.com/azure/ai-foundry/openai/how-to/provisioned-throughput-onboarding?view=foundry-classic)
|
||||
- [Foundry Models from partners and community (Phi)](https://learn.microsoft.com/azure/ai-foundry/foundry-models/concepts/models-from-partners?view=foundry-classic)
|
||||
- [Azure OpenAI models and regions for Foundry Agent Service](https://learn.microsoft.com/azure/ai-foundry/agents/concepts/model-region-support?view=foundry-classic)
|
||||
- [Azure OpenAI quotas and limits](https://learn.microsoft.com/azure/ai-foundry/openai/quotas-limits?view=foundry-classic)
|
||||
|
||||
Content translated to Norwegian, reorganized, and augmented with decision guidance for Norwegian public sector.
|
||||
|
||||
Research date: 2026-02
|
||||
Loading…
Add table
Add a link
Reference in a new issue