ms-ai-architect/skills/ms-ai-advisor/references/platforms/model-catalog-2026.md
Kjell Tore Guttormsen baa2d0220b feat(ultraplan-local): v1.6.0 — /ultraresearch-local deep research command
Add /ultraresearch-local for structured research combining local codebase
analysis with external knowledge via parallel agent swarms. Produces research
briefs with triangulation, confidence ratings, and source quality assessment.

New command: /ultraresearch-local with modes --quick, --local, --external, --fg.
New agents: research-orchestrator (opus), docs-researcher, community-researcher,
security-researcher, contrarian-researcher, gemini-bridge (all sonnet).
New template: research-brief-template.md.

Integration: --research flag in /ultraplan-local accepts pre-built research
briefs (up to 3), enriches the interview and exploration phases. Planning
orchestrator cross-references brief findings during synthesis.

Design principle: Context Engineering — right information to right agent at
right time. Research briefs are structured artifacts in the pipeline:
ultraresearch → brief → ultraplan --research → plan → ultraexecute.

Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>
2026-04-08 08:58:35 +02:00

18 KiB
Raw Blame History

Azure AI Modellkatalog 2026 — Oversikt og valgveiledning

Last updated: 2026-02 (research via microsoft-learn MCP) Status: Aktiv — dekker alle modeller tilgjengelig i Microsoft Foundry per 2026-02


Oversikt

Microsoft Foundry (tidligere Azure AI Foundry) har per 2026-02:

  • 1 900+ frontier-modeller solgt direkte av Azure
  • 11 000+ totalt i katalogen (inkl. partner og community)
  • 40+ Azure-regioner

Modellkatalogen er delt i to kategorier:

  1. Foundry Models sold directly by Azure (azure-openai) — OpenAI-serien (GPT-5, GPT-4.1, o-serien)
  2. Foundry Models sold directly by Azure (azure-direct-others) — DeepSeek, Meta, Mistral, xAI, Cohere mfl.

1. GPT-5-serien (GA august 2025)

OpenAIs flaggskip reasoning-modeller. Alle versjonene støtter Chat Completions API, Responses API, structured outputs, text/image input og parallel tool calling.

Tilgangsmodell:

  • gpt-5, gpt-5-codex, gpt-5-pro — krever registrering: https://aka.ms/oai/gpt5access
  • gpt-5-mini, gpt-5-nano, gpt-5-chat — åpen tilgang, ingen registrering
Modell GA-dato Kontekstvindu Max output Merknad
gpt-5 2025-08-07 400K (input 272K, output 128K) 128K Flagship, sterkest reasoning. PTU: 4 750 input TPM/PTU
gpt-5-mini 2025-08-07 400K (input 272K, output 128K) 128K Kostnadsoptimalisert. PTU: 23 750 input TPM/PTU
gpt-5-nano 2025-08-07 400K (input 272K, output 128K) 128K On-device/edge, lavest pris
gpt-5-chat 2025-08-07 (Preview) 128K 16 384 Conversation-optimalisert, emosjonell intelligens
gpt-5-codex 2025-09-11 400K (input 272K, output 128K) 128K Kodeoptimalisert (Codex CLI/VS Code)
gpt-5-pro 2025-10-06 400K (input 272K, output 128K) 128K Høyeste kapabilitet
gpt-5.1 2025-11-13 400K (input 272K, output 128K) 128K Neste generasjon
gpt-5.2 2025-12-11 400K 128K Siste versjon

PTU-ratio for GPT-5: 1 output token teller som 8 input tokens mot utnyttelsesgrensen.

Styrker:

  • Dyp reasoning og multi-step logikk
  • Bedre enn GPT-4.1 på komplekse oppgaver, vitenskap, koding og matematikk
  • Høyere latens enn GPT-4.1 (pga. dypere resonneringsprosess)

2. GPT-4.1-serien (GA april 2025)

Optimalisert for høy hastighet, høy throughput og enterprise-skalering. Ingen reasoning-overhead — rask og forutsigbar.

Modell GA-dato Kontekstvindu Max output Merknad
gpt-4.1 2025-04-14 1 047 576 (standard), 128K (PTU), 300K (batch) 32 768 Lengst kontekst, 4:1 input/output PTU-ratio
gpt-4.1-mini 2025-04-14 1 047 576 32 768 Balansert pris/ytelse
gpt-4.1-nano 2025-04-14 1 047 576 32 768 Lavest pris, 59 400 input TPM/PTU

PTU-ratio for GPT-4.1: 1 output token teller som 4 input tokens.

Styrker:

  • Ekstremt lang kontekst (1M tokens)
  • Lav latens, høy throughput
  • Ideell for real-time chat, kundesupport, høyvolum summarisering
  • Code og instruction following — bedre enn GPT-4o

Sammenligning GPT-5 vs GPT-4.1:

Dimensjon GPT-5 GPT-4.1
Modelltype Reasoning Non-reasoning, rask
Best for Kompleks reasoning, flersteg logikk Real-time chat, faktaspørsmål, høyvolum
Latens Høyere Lavere
Throughput Moderat Høy
Kontekst 272K input, 128K output Opp til 1M tokens

3. o-serien — Reasoning Models

Spesialiserte reasoning-modeller som bruker mer tid på å forstå brukerens forespørsel. Sterkest på vitenskap, koding og matematikk.

Modell GA-dato Kontekstvindu Max output Merknad
o4-mini 2025-04-16 200K input 100K output Kostnadseffektiv reasoning, image-støtte. PTU: 5 400 input TPM/PTU
o3 2025-04-16 200K input 100K output Sterk reasoning + image. PTU: 3 000 input TPM/PTU
o3-pro 2025-06-10 200K input 100K output Maksimal reasoning, anbefales background mode
o3-mini 2025-01-31 200K input 100K output Text-only, raskere enn o3
o1 2024-12-17 200K input 100K output Etablert reasoning + image
codex-mini 2025-05-16 200K input 100K output Fine-tunet o4-mini for koding

API-karakteristikker:

  • Bruker max_completion_tokens (Chat Completions API) eller max_output_tokens (Responses API)
  • Støtter IKKE temperature, top_p, presence_penalty, frequency_penalty
  • Streaming for o3 er begrenset tilgang

4. DeepSeek-modeller

Open source-modeller tilgjengelig som "Foundry Models sold directly by Azure". Alle støtter Global Standard deployment i alle regioner.

Modell Type Kontekst Tool calling Merknad
DeepSeek-R1 Reasoning 163 840 tokens Nei Sterk på reasoning + koding
DeepSeek-R1-0528 Reasoning 163 840 tokens Nei Oppdatert versjon
DeepSeek-V3-0324 MoE chat 131 072 tokens Ja Mixture-of-Experts
DeepSeek-V3.1 MoE chat 131 072 tokens Ja Oppdatert MoE
DeepSeek-V3.2 MoE reasoning 128 000 tokens Nei Nyeste versjon
MAI-DS-R1 Reasoning 163 840 tokens Nei Microsofts variant av DeepSeek-R1

PTU for DeepSeek: 4 000 input TPM/PTU (DeepSeek-R1, V3-0324, R1-0528).

Norway East: Alle DeepSeek-modeller er tilgjengelig i Norway East via Global Standard deployment.

Viktig: DeepSeek-R1 støtter ikke tool calling — bytt til V3-0324 eller V3.1 hvis tool use trengs.


5. Phi-serien (Small Language Models)

Microsofts egne SLM-er (Small Language Models), optimalisert for effektiv inferens med begrenset ressursbruk.

Modell Kontekst Modalitet Tool calling Merknad
Phi-4 16 384 tokens Text Nei Generell SLM, bred språkdekning (46 språk)
Phi-4-mini-instruct 131 072 tokens Text Nei Liten og rask, brukt i MS Edge
Phi-4-multimodal-instruct 131 072 tokens Text + bilde + lyd Nei Multimodal SLM
Phi-4-reasoning 32 768 tokens Text Nei Reasoning-variant
Phi-4-mini-reasoning 128 000 tokens Text Nei Kompakt reasoning

Bruksscenarioer:

  • On-device / Foundry Local inference (Phi-4-mini-instruct er optimalisert for ONNX)
  • Lav kostnad, høy throughput
  • Edge og offline-scenarioer
  • Ikke egnet for komplekse multi-step reasoning

6. Andre bemerkelsesverdige modeller

Meta Llama

Modell Kontekst Merknad
Llama-4-Maverick-17B-128E-Instruct-FP8 1M tokens Multimodal (text + bilde), 17B aktive parametere (128 eksperter MoE)
Llama-3.3-70B-Instruct 128 000 tokens (output: 8 192) Solid general-purpose, åpen kildekode. PTU: 8 450 input TPM/PTU

Mistral

Modell Type Merknad
Mistral-Large-3 Chat (text + bilde) Tool calling støttet, kun West US 3
mistral-document-ai-2505/2512 Image-to-Text PDF/bilde til strukturert tekst, alle regioner

Cohere

Modell Merknad
Cohere-command-a Sterk på RAG og enterprise-søk
Cohere-rerank-v4.0-pro/fast Re-ranking for søkepipeliner
embed-v-4-0 Embedding-modell

xAI Grok

Modell Merknad
grok-4 Frontiermodell, alle regioner inkl. Norway East
grok-3, grok-3-mini Eldre versjon

7. Modellsammenligningstabell

Modell Kontekst (input) Max output PTU: input TPM/PTU Latency target (99%) Norway East Tilgang
gpt-5 272K 128K 4 750 >50 TPS Via Agent Service Registrering
gpt-5-mini 272K 128K 23 750 >80 TPS Via Agent Service Åpen
gpt-5-nano 272K 128K Høy >100 TPS Via Agent Service Åpen
gpt-4.1 1M 32 768 3 000 >40 TPS Ja (full) Åpen
gpt-4.1-mini 1M 32 768 14 900 >50 TPS Ja (full) Åpen
gpt-4.1-nano 1M 32 768 59 400 >60 TPS Ja (full) Åpen
o4-mini 200K 100K 5 400 >66 TPS Ja (full) Åpen
o3 200K 100K 3 000 >40 TPS Ja (full) Åpen
o3-mini 200K 100K 2 500 >66 TPS Ja (full) Åpen
o1 200K 100K 230 >25 TPS Ja (full) Åpen
DeepSeek-R1 163K 163K 4 000 >50 TPS Ja (Global std) Åpen
DeepSeek-V3-0324 131K 131K 4 000 >50 TPS Ja (Global std) Åpen
Llama-3.3-70B-Instruct 128K 8 192 8 450 >50 TPS Ja (Global std) Åpen
Phi-4-mini-instruct 131K 4 096 Ja Åpen
Phi-4 16K 16K Ja Åpen

Merk: PTU-tall er fra Microsoft Learn og kan endres. Se Foundry PTU-kalkulator for oppdaterte tall.


8. Prismodeller

Tre hovedmodeller for deployment

Deploymenttype Betaling Dataresidens SLA Egnet for
Global Standard Per token (PAYG) Ingen garanti, data kan rutes globalt Ja Testing, variabel last
Data Zone Standard Per token (PAYG) Innenfor US eller EU Ja GDPR-krav, variabel last
Regional Provisioned (PTU) Per PTU per time Garantert til valgt region Ja Produksjon, forutsigbar last

Pay-as-you-go (PAYG)

Token-basert fakturering. Offisiell prising: https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/

Generelle prisleier (relativ, ikke eksakt):

Prisnivå Modeller Merknad
Lavest (nano) gpt-5-nano, gpt-4.1-nano, Phi-4-mini On-device, enkle oppgaver
Lav gpt-4.1-mini, gpt-5-mini, o4-mini, o3-mini Høyvolum, enkle til moderate
Middels gpt-4.1, DeepSeek-V3, Llama-3.3-70B Generelle enterprise-workloads
Høy gpt-5, o3, o1 Komplekse reasoning-oppgaver
Høyest gpt-5-pro, o3-pro, gpt-5.2 Maksimal kapabilitet

Provisioned Throughput (PTU)

Garantert kapasitet med forutsigbar latens. Egnet for:

  • Produksjonsworkloads med stabil trafikk
  • Latency-sensitive applikasjoner
  • Høyvolum pipelines der PAYG-variasjon er et problem

Viktige PTU-parametere:

  • Minimum deployment: 15 PTU (global/data zone) eller 2550 PTU (regional)
  • Skaleringsinkrement: 5 PTU (global/data zone) eller 2550 PTU (regional)
  • PTU er modell-agnostisk quota — kan brukes til ulike modeller innen regionen
  • PTU kjøpes time-basert. Azure Reservations gir vesentlig rabatt ved langsiktig bruk

Input/output-ratio per modell:

Modell 1 output token = N input tokens
GPT-5-serien 8 input tokens
GPT-4.1-serien 4 input tokens
DeepSeek-R1/V3 1 (standard, som input)
Llama-3.3-70B 4 input tokens (unntak fra standard)

Fine-tuning-kostnader

Ved bruk av fine-tuned modeller:

  • Standard: PAYG + $1,70/time hosting
  • Global Standard: PAYG + $1,70/time hosting
  • PTU: Per PTU/time (ingen ekstra hosting)
  • Developer Tier: PAYG uten hosting, ingen garanti, slettes etter 24 timer

9. Regional tilgjengelighet

Norway East — detaljert status

Azure OpenAI-modeller (regional provisioned):

Modell Norway East
gpt-4.1 (2025-04-14) Ja
gpt-4.1-mini (2025-04-14) Ja
gpt-4.1-nano (2025-04-14) Ja
o3 (2025-04-16) Ja
o4-mini (2025-04-16) Ja
o3-mini (2025-01-31) Ja
o1 (2024-12-17) Ja
gpt-4o (2024-08-06) Ja
gpt-4o (2024-11-20) Ja
gpt-4o-mini Ja
gpt-5 (2025-08-07) Via Foundry Agent Service / Global Standard
gpt-5-mini (2025-08-07) Via Foundry Agent Service / Global Standard
gpt-5-nano (2025-08-07) Via Global Standard
gpt-5.1 (2025-11-13) Via Foundry Agent Service
o3-deep-research Ja (ett av kun to regioner globalt)
computer-use-preview Nei — kun East US 2, Sweden Central, South India
sora (video) Nei — kun East US 2, Sweden Central
gpt-image-1 Begrenset tilgang, ikke bekreftet Norway East

Foundry Models sold directly by Azure (DeepSeek, Llama, Mistral, Grok):

Alle disse er tilgjengelig i Norway East via Global Standard deployment:

  • DeepSeek-R1, R1-0528, V3-0324, V3.1, V3.2
  • Llama-4-Maverick, Llama-3.3-70B
  • Grok-4 (alle varianter)
  • MAI-DS-R1
  • mistral-document-ai

Sweden Central — referanse

Sweden Central har full feature coverage og er anbefalt for pilot-prosjekter med nyeste features:

  • GPT-5-serien (alle varianter inkl. gpt-5-mini, nano)
  • Alle GPT-4.1-varianter
  • o-serien (o3, o4-mini, o3-mini, o1, o3-pro)
  • Computer-Use (computer-use-preview) — JA
  • Sora video generation — JA
  • DeepSeek, Grok, Llama, Mistral — alle tilgjengelig
  • Foundry Agent Service (GA), Workflows, Deep Research

West Europe

Full dekning av GPT-5, GPT-4.1, o-serien, DeepSeek-modeller og alle Foundry Models sold directly by Azure.

Oppsummering: Nordiske regioner

Feature Norway East Sweden Central West Europe
GPT-4.1-serien Ja Ja Ja
GPT-5 (regional PTU) Via Global std/Agent Service Ja Ja
o3, o4-mini Ja Ja Ja
DeepSeek (alle) Ja Ja Ja
Llama 3.3-70B Ja Ja Ja
Computer-Use Nei Ja Nei
Sora Nei Ja Nei
o3-deep-research Ja Nei Ja
Dataresidens (GDPR) Norsk Svensk Europeisk

10. For Cosmo: Modellvalgveiledning

Beslutningsflyt

Er oppgaven enkel (chat, Q&A, summarisering)?
├── Ja, høyvolum og kostnad er kritisk → gpt-4.1-nano / gpt-5-nano
├── Ja, balansert → gpt-4.1-mini / gpt-5-mini / o4-mini
└── Nei, kompleks

Er oppgaven kompleks (reasoning, kode, analyse)?
├── Trenger dyp reasoning + tid til svaret → gpt-5 / o3 / o3-pro
├── Rask reasoning + bilde-input → o4-mini
└── Kode-spesifikk → gpt-5-codex / codex-mini

Har kunden Norway East-krav (dataresidens)?
├── Ja → GPT-4.1-serien, o3, o4-mini (full støtte)
│         DeepSeek (Global Standard — data kan rutes globalt, vurder nøye)
│         GPT-5 → kun via Global Standard/Agent Service (data kan forlate Norway East)
└── Nei → vurder Sweden Central for full feature coverage

Er kunden offentlig sektor (Schrems II / GDPR)?
├── Ja, strenge krav → Regional Provisioned i Norway East
│         Velg: gpt-4.1, o3, o4-mini — bekreftet regional PTU
│         Unngå: Global Standard deployment (data rutes globalt)
└── Nei → Global Standard er akseptabelt

Trenger kunden open-source/selvhostet-alternativ?
├── Ja, reasoning → DeepSeek-R1 / MAI-DS-R1
├── Ja, chat + tool use → DeepSeek-V3-0324 / Llama-3.3-70B
└── Ja, liten modell (edge/on-device) → Phi-4-mini-instruct / Foundry Local

Hurtigguide per scenario

Scenario Anbefalt modell Begrunnelse
Intern chatbot, Teams gpt-4.1-mini Raskt, billig, godt nok
RAG over store dokumenter gpt-4.1 (1M kontekst) eller gpt-5 Lang kontekst, god instruction following
Juridisk/medisinsk analyse gpt-5 eller o3 Dyp reasoning, nøyaktighet
Kodegjennomgang / copilot gpt-5-codex / gpt-4.1 Kodeoptimalisert
Kostnadseffektiv høyvolum gpt-4.1-nano / gpt-5-nano Lavest pris, høy throughput
Multi-agent orkestrering gpt-5 / gpt-4.1 (som orkestratormodell) Sterk instruction following
On-device / edge / offline Phi-4-mini-instruct (Foundry Local) Kjører lokalt, ingen sky
Open-source med reasoning DeepSeek-R1 / MAI-DS-R1 Åpen kildekode, sterk reasoning
Sammenligning av alternativer Model Router Automatisk routing, opp til 60% kostnadsbesparelse
DPIA-kritisk (data forblir i Norge) gpt-4.1/o3 + Regional PTU Norway East Garantert dataresidens

Spørsmål å stille kunden

  1. "Hva er primæroppgaven — chat/søk, analyse, koding eller kreativt innhold?"
  2. "Hvilke volumforventninger har dere (tokens/måned)?"
  3. "Er dataresidens et krav, eller er Global Standard akseptabelt?"
  4. "Trenger dere open-source/selvhostet alternativ av compliance-hensyn?"
  5. "Er latens kritisk (real-time UI) eller kan modellen tenke seg om (batch/agent)?"
  6. "Skal modellen kjøre på edge/on-device?"

Norway East-spesifikke råd

  • Bruk Regional PTU for produksjonskritiske workloads med dataresidensbehov
  • gpt-4.1-serien er primærvalget — full regional PTU, lav latens
  • o3 og o4-mini er tilgjengelig med regional PTU i Norway East
  • GPT-5 er tilgjengelig via Foundry Agent Service og Global Standard, men data kan rutes utenfor Norway East — vurder nøye for sensitive data
  • Deep Research (o3-deep-research) er tilgjengelig i Norway East — ett av kun to regioner globalt
  • DeepSeek bruker Global Standard (alle regioner) — ikke egnet for strenge dataresidens-krav

Kilder og verifisering

Adapted from Microsoft Learn documentation (CC BY 4.0):

Content translated to Norwegian, reorganized, and augmented with decision guidance for Norwegian public sector.

Research date: 2026-02