ms-ai-architect/skills/ms-ai-advisor/references/platforms/azure-ai-foundry.md
Kjell Tore Guttormsen a583599ab1 feat(ms-ai-architect): R20 — Category-backfill på 25 kategorisløse ref-filer via insertMetaField [skip-docs]
Ny testet primitiv transform.insertMetaField (anker + 500B-back-off som insertHeaderFields, idempotent på eksakt label, body byte-identisk; 6 tester) + backfill-category.mjs (deterministisk folder->category-regel, hard per-fil-invariant, insert-only, aborterer for skriving ved avvik).

Fordeling: 14 Solution Architecture & Advisory (architecture/), 6 Microsoft AI Platforms (platforms/+development/), 4 Responsible AI & Governance, 1 MLOps & GenAIOps. Label = engelsk Category (322 vs 42 Kategori). Eksisterende recommended-mcp-servers/rag-maturity-model urort.

Roadmap: R20 done + R21 (Status/Last-updated not-due) encoded. Verifisering: 0 kategorislose filer (var 25); diff +25/-0; idempotent re-run; suite 764/764 exit 0.
2026-07-06 07:39:54 +02:00

20 KiB

Microsoft Foundry (Microsoft Foundry) - Knowledge Base

Last updated: 2026-06-24 (modellkatalog reconciled mot model-catalog-2026.md; øvrig innhold research via microsoft-learn MCP juni 2026) Status: GA (General Availability) — rebrandet til Microsoft Foundry desember 2025 Source: https://learn.microsoft.com/azure/foundry/foundry-models/concepts/models-sold-directly-by-azure Category: Microsoft AI Platforms


Hva er Microsoft Foundry?

NB: Plattformen heter nå Microsoft Foundry. Microsoft Foundry er rebrandet (desember 2025). Dokumentasjonen sier eksplisitt: "Microsoft Foundry is now Microsoft Foundry." Portalen finnes fortsatt på https://ai.azure.com.

Microsoft Foundry er Microsofts unified platform-as-a-service for enterprise AI-operasjoner, modellbygging og applikasjonsutvikling. Plattformen ble opprinnelig lansert ved Ignite 2024 som etterfølger til Azure AI Studio.

To portaler:

  • Microsoft Foundry (classic) — støtter alle resource types: Azure OpenAI, hub-baserte prosjekter, Foundry-prosjekter
  • Microsoft Foundry (new) — kun Foundry-prosjekter, optimalisert for multi-agent-applikasjoner

Nøkkeltall:

  • 1,900+ modeller «Foundry Models sold by Azure» (også kalt «Azure Direct Models»; frontier models)
  • 11,000+ totalt i katalogen
  • 40+ Azure-regioner

Konsept: Microsoft posisjonerer Foundry som en "agent factory" — standardiserte komponenter og prosesser for å bygge intelligente systemer.


Hvordan skiller Foundry seg fra forgjengerne?

Plattform Fokus Status
Azure OpenAI Studio Direkte tilgang til OpenAI-modeller Konsolidert inn i Foundry
Azure AI Studio Generativ AI-utvikling Rebrandet til Foundry
Azure Machine Learning Tradisjonell ML, custom models Lever videre, komplementær

Foundry konsoliderer de tre førstnevnte til én plattform, mens Azure ML forblir separat for tradisjonell maskinlæring.


Kjernekomponenter

1. Foundry Models

Katalog med 1,900+ «Foundry Models sold by Azure» (Azure Direct Models), pluss community/partner-modeller:

  • OpenAI: GPT-5-generasjonen (gpt-5/-mini/-nano/-chat/-codex/-pro fra aug 2025, utvidet med gpt-5.1→5.5 t.o.m. apr 2026), GPT-4.1-serien (gpt-4.1, gpt-4.1-mini, gpt-4.1-nano), GPT-4o, o-serien (o3, o4-mini, o3-mini, o1)
  • Anthropic: Claude-modeller (via marketplace)
  • Meta: Llama 4 (Maverick 17B), Llama 3.3-70B
  • DeepSeek: DeepSeek-R1, DeepSeek-V3-0324, DeepSeek-R1-0528, DeepSeek-V3.1
  • xAI: Grok-4, Grok-3, Grok-3-mini
  • Mistral: Mistral-document-ai og andre
  • Spesialiserte: Vision, audio, domene-spesifikke

GPT-5-generasjonen (GA august 2025, utvidet t.o.m. april 2026)

Modell Context Max output Tilgang
gpt-5 (2025-08-07) 400K (input 272K) 128K Krever registrering
gpt-5-mini (2025-08-07) 400K 128K Åpen
gpt-5-nano (2025-08-07) 400K 128K Åpen
gpt-5-chat (2025-08-07) 128K 16,384 Åpen (Preview)
gpt-5-codex (2025-09-11) 400K 128K Krever registrering
gpt-5-pro (2025-10-06) 400K 128K Registrering
gpt-5.1 (2025-11-13) 400K (input 272K) 128K + gpt-5.1-codex, gpt-5.1-codex-mini
gpt-5.2 (2025-12-11) 400K (input 272K) 128K + gpt-5.2-codex, gpt-5.2-chat (preview)
gpt-5.3-codex (2026-02-24) 400K (input 272K) 128K Kun -codex/-chat-varianter (ingen bar gpt-5.3)
gpt-5.4 (2026-03-05) ~1,05M 128K Kontekstsprang til ~1M; + -mini/-nano/-pro
gpt-5.5 (2026-04-24) ~1,05M (input 922K) 128K Data Zone (EU) i Norway East (sammen med gpt-5.4)

GPT-5 støtter reasoning, Chat Completions API, Responses API, structured outputs, text/image input, parallel tool calling.

Full, region-verifisert modellkatalog (GA-datoer, kontekst, Norway East/Sweden Central-residens per deployment-type): se model-catalog-2026.md. Tabellen over er et utdrag — katalogen er kanonisk kilde for modell-spesifikke detaljer.

GPT-4.1-serien (GA april 2025)

Modell Kontekst Merknad
gpt-4.1 (2025-04-14) 1 million tokens Lengste kontekst, 4 input = 1 output PTU-ratio
gpt-4.1-mini (2025-04-14) Standard Balansert pris/ytelse
gpt-4.1-nano (2025-04-14) Standard Lavest pris, 59,400 TPM per PTU

Alle GPT-4.1-modeller tilgjengelige i Norway East via Global (Standard/Provisioned) — men IKKE som Norge-resident deployment (kun gpt-4o/gpt-4o-mini er regionale i Norway East). Se model-catalog-2026.md seksjon 9.

DeepSeek-modeller (Foundry Models sold by Azure)

Modell Type Context
DeepSeek-R1 Reasoning 163,840 tokens
DeepSeek-V3 (Legacy) MoE 131,072 tokens
DeepSeek-V3-0324 MoE 131,072 tokens
DeepSeek-R1-0528 Reasoning 163,840 tokens
DeepSeek-V3.1 MoE 131,072 tokens

DeepSeek-modeller er tilgjengelige i Norway East.

2. Foundry Agent Service

Status: GA (mai 2025)

Managed runtime for å bygge multi-agent systemer:

  • Persistent workflows
  • Error recovery
  • Inter-agent kommunikasjon
  • Innebygd tilgang til SharePoint, Fabric, Bing, AI Search
  • 1,400+ Logic Apps connectors
  • Azure Logic Apps-triggere (automatisk invokasjon ved hendelser)
  • Tracing og debugging av agent-tråder
  • VS Code-extension (Microsoft Foundry for VS Code)

Post-GA tillegg (juni 2025):

  • MCP tool — agenter kobler til remote Model Context Protocol-servere. Autentisering med Microsoft Entra ID (AgenticIdentityToken).
  • Deep Research tool — se egen seksjon
  • A2A tool (preview) — Agent-to-Agent kommunikasjon via standardisert A2A-protokoll (a2a-protocol.org). Primæragenten beholder kontroll; subagentens svar returneres tilbake.

Viktig skilnad A2A vs Workflows:

  • A2A tool: Agent A kaller Agent B, får svar tilbake, Agent A fortsetter
  • Workflows: Agent A kaller Agent B, Agent B tar over ansvaret for brukeren

3. Foundry Workflows (visuell multi-agent orkestrering)

Status: Tilgjengelig (GA). Erstatter Connected agents (classic), som er deprecated og pensjoneres 2027-03-31 og ikke finnes i nye Foundry Agent Service — migrer til Workflows eller A2A-tool.

UI-basert verktøy for å lage deklarative, forhåndsdefinerte sekvenser av handlinger:

  • Visuell builder i Microsoft Foundry-portalen
  • Branching-logikk (if/else) og variabelhåndtering uten kode
  • Human-in-the-loop-steg (godkjenninger, avklarende spørsmål)
  • YAML-basert konfigurasjon — kan redigeres i VS Code
  • To modes: Declarative (Low-code) og Hosted (Pro-code)
  • Versjonering, change logs, visuell monitorering
  • Egnet for: multisteg godkjenningsprosesser, compliance-innsamling, incident triage, ETL

4. Foundry Local (on-device inference)

Status: Preview

Fullverdig on-device AI inference:

  • Kjører AI-modeller lokalt via CLI, SDK eller REST API
  • OpenAI-kompatibelt REST API (dynamisk port)
  • ONNX Runtime med støtte for CPU, GPU, NPU (Intel, AMD, Qualcomm)
  • Model cache — modeller lastes ned én gang, brukes offline
  • Krever ikke Azure-abonnement for inference
  • Prompts forblir på enheten (nettverkstrafikk kun ved modell-nedlasting)
  • SDK: Python, JavaScript, C# (WinML for Windows, cross-platform), Rust
  • AI Toolkit for VS Code-integrasjon
  • Eksempel: foundry model run qwen2.5-0.5b
  • Begrensning: Ikke for distribuert/produksjons-/multi-machine-deployment

5. Computer-Using Agents (CUA)

Status: gpt-5.4 med innebygd computer-tool (limited access — registrering påkrevd)

gpt-5.4-modellen med innebygd computer-tool via Responses API (tools=[{"type": "computer"}]):

  • Autonom navigasjon: klikker knapper, fyller skjemaer, navigerer multi-page workflows
  • Dynamisk tilpasning til UI-endringer
  • Cross-application (web og desktop)
  • Natural language interface
  • Region/residens: verifiser deployment-region for gpt-5.4 mot region-availability — den utgåtte computer-use-preview-modellen var begrenset til East US 2 / Sweden Central / South India (IKKE Norway East)
  • Kontekst/output: følger gpt-5.4 (de tidligere computer-use-preview-tallene 8 192 / 1 024 er utgått)
  • Registrering (limited access, gpt-5.4): https://aka.ms/OAI/gpt54access

6. Deep Research tool

Status: Deprecated — det dedikerte Deep Research-toolet er utfaset. Bruk i stedet o3-deep-research-modellen via web search-toolet eller en MCP-tool (Responses API, 2025-11-15-preview). Selve modellen er fortsatt aktiv.

Multisteg web-research integrert i Foundry Agent Service:

  • Modell: o3-deep-research (2025-06-26)
  • Regioner: Kun West US og Norway East (bare disse to)
  • Grounding med Bing Search (Grounding with Bing Search resource påkrevd)
  • Multisteg reasoning: åpner og leser mange sider, syntetiserer til citation-rich rapport
  • Bruker gpt-4o for å avklare research-scope
  • Fra API 2025-11-15-preview: kan bruke MCP-servere som intern datakilde
  • Kvoter: Enterprise 30K RPS / 30M TPM, Default 3K RPS / 3M TPM

7. Foundry Tools

Pre-built AI-tjenester:

  • Speech: Speech-to-text (gpt-4o-transcribe), text-to-speech, Realtime API (GA august 2025)
  • Vision: Image/video analyse, OCR, Sora (video generation, kun East US 2 og Sweden Central)
  • Language: Sentiment, NER, key phrase extraction
  • Document Intelligence: Strukturert data fra dokumenter
  • Translator: 100+ språk
  • Guardrails and controls (tidligere «Content Safety»/content filters): PII-deteksjon m.fl. via fire intervensjonspunkter (user input, tool call, tool response, output). Modell-guardrails GA, agent-guardrails i preview; default Microsoft.DefaultV2.

8. Model Router

Intelligent routing som velger optimal modell basert på:

  • Prompt-kompleksitet
  • Reasoning-krav
  • Task type

Modi:

  • Balanced (default): Kostnadseffektiv innenfor 1-2% kvalitetsband
  • Quality: Beste modell uavhengig av kostnad
  • Cost: Aksepterer 5-6% kvalitetsvarians for lavest kostnad

Støtter GPT-5-serien, Claude Opus, Llama, DeepSeek, Grok og 18+ modeller.

9. SDK

Tilgjengelig i:

  • Python
  • C#
  • JavaScript
  • Java (A2A tool støttes nå i Java SDK; SDK-tabell: Python/C#/JavaScript/Java/REST alle ✔️)

Når velge hva?

Microsoft Foundry vs Copilot Studio

Dimensjon Copilot Studio Microsoft Foundry
Målgruppe Business users, citizen devs Developers, data scientists
Tilnærming Low-code, drag-and-drop Code-first, SDK
Modeller Primært GPT 1,900+ frontier + 11,000+ totalt
Governance Begrenset Enterprise-grade
Integrasjon M365-fokusert Bred Azure/enterprise
Use case Interne chatbots, IT helpdesk Forretningskritiske AI-systemer

Anbefaling: Komplementære, ikke konkurrerende. Bruk Copilot Studio for rask prototyping internt, Foundry for produksjonskritiske systemer.

Microsoft Foundry vs Direkte Azure OpenAI

Scenario Anbefaling
Kun OpenAI API-kall, minimal orkestrering Direkte Azure OpenAI
Multi-model sammenligning Foundry
Agenter med multi-step orkestrering Foundry
Enterprise governance krav Foundry
Planlegger skalering Foundry

Nøkkelinnsikt: Foundry inkluderer Azure OpenAI uten ekstra plattformkostnad.

Microsoft Foundry vs Azure Machine Learning

Behov Plattform
Trene custom models på egne data Azure ML
Orkestrere pre-built frontier models Foundry
Prediction (klassifisering, regresjon) Azure ML
Generativ AI og agenter Foundry

Mange bruker begge: Azure ML for data-pipeline og custom models, Foundry for generativ AI lag oppå.


Prising

Hovedprinsipper

  • Plattformen selv er gratis — ingen plattformavgift
  • Betaler for faktisk bruk: modeller, compute, tjenester
  • Token-basert for inference (input/output tokens) — priset per million tokens
  • Model Router kan optimalisere kostnader automatisk

Priskomponenter

  1. Model inference: Per million tokens (varierer per modell)
  2. Fine-tuning: Per token i treningsdata + hosting-timer etter deployment
  3. Managed compute: Per-minutt for dedicated instanser
  4. Agent Service: Underliggende modellbruk + Logic Apps connector-kostnader
  5. Deep Research: Bing Search tool-kall + o3-deep-research tokens
  6. Storage, monitoring, etc.: Standard Azure-priser

PTU-ratio (throughput estimation)

  • GPT-5: 1 output token = 8 input tokens
  • GPT-4.1: 1 output token = 4 input tokens
  • Bruk Foundry PTU quota calculator for estimering

Kostnadsoptimalisering

  • Bruk Model Router i "Cost" mode for høyvolum
  • Velg mindre modeller (gpt-5-mini vs gpt-5, gpt-4.1-nano vs gpt-4.1) for enklere oppgaver
  • Serverless for variable workloads, managed compute for stabile
  • Offisiell prising: https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/

Regional tilgjengelighet

Anbefalte regioner (mest komplett feature-set)

  • East US 2
  • Sweden Central
  • West US / West US 3

Nordiske regioner

Sweden Central:

  • Full feature coverage
  • Azure OpenAI (alle modeller)
  • GPT-4.1-serien, GPT-5-serien
  • DeepSeek-R1/V3, Grok-4, Llama 4
  • Speech, Language, Vision, Document Intelligence
  • Guardrails and controls (tidl. Content Safety), Agent Service (GA)
  • Foundry Workflows, Prompt Flow (pensjoneres 2027-04-20 → Microsoft Agent Framework), Tracing
  • Sora video generation
  • Computer-Use (computer-use-preview) — JA
  • Realtime API (GA)

Norway East:

  • God dekning via Global — men Norge-residens er begrenset
  • Azure OpenAI tilgjengelig via Global Standard (data prosesseres globalt): GPT-4o, GPT-4.1-serien, o3, o4-mini, o3-mini, o1, GPT-5-familien
  • Norge-resident (data forblir i Norge — Standard/Regional PTU): KUN gpt-4o (Standard) + gpt-4o/gpt-4o-mini (Regional PTU). gpt-4.1, o-serien og hele GPT-5-familien er IKKE regionale i Norway East (verifisert 2026-06-18 mot Learn region-tabeller)
  • GPT-5-familien: kun Global Standard/Provisioned (data globalt). gpt-5.4 og gpt-5.5 via Data Zone Standard (EU-residens) — eneste GPT-5-modeller med residens-tier i Norway East
  • DeepSeek-R1, DeepSeek-V3-0324, DeepSeek-R1-0528 (Foundry Models)
  • Grok-4, Llama-modeller
  • Foundry Agent Service (GA)
  • Foundry Workflows
  • Deep Research (o3-deep-research) — Norway East er ett av kun TO regioner globalt
  • Responses API (bekreftet)
  • IKKE tilgjengelig i Norway East:
    • Computer Use: computer-use-preview er utgått (computer use bruker nå gpt-5.4 + computer-tool) — verifiser gjeldende region; preview-modellen var kun East US 2 / Sweden Central / South India
    • Sora video generation — kun East US 2 og Sweden Central
    • GPT-image-1 — begrenset tilgang

On-Device / Edge

Foundry Local (Preview) støtter full on-device inference:

  • Windows (WinML, NPU-akselerasjon), Linux, macOS
  • Lokale LLMs via CLI, SDK, REST API
  • Krever ikke Azure-abonnement
  • Ikke for distribuert produksjonsdeployment

Arkitekturprinsipper

Resource-struktur

Microsoft.CognitiveServices/account (kind: AIServices)
├── Foundry resource (top-level)
│   ├── Projects (development containers)
│   ├── Deployments (model endpoints)
│   └── Connections (Key Vault, Storage, MCP-servere, etc.)

Separasjon av concerns

  • Management operations: Sikkerhet, connectivity, deployments → Top-level resource
  • Development activities: Agenter, filer, evalueringer → Project scope
  • Agent identities: Unpublished agents bruker shared project-identity; published agents får unik identitet (Entra ID)

Networking

  • Private endpoints støttet
  • VNet integration
  • Container injection for agent-kommunikasjon med on-prem systemer

For Cosmo: Beslutningsveiledning

Når anbefale Foundry

  1. Multi-model behov (OpenAI + DeepSeek + Grok + Llama)
  2. Multi-agent orkestrering — spesielt med Foundry Workflows
  3. Regulerte industrier (governance-krav, RBAC, private endpoints)
  4. Forretningskritiske AI-systemer
  5. Langsiktig AI-satsing med skaleringsplaner
  6. Deep Research-behov (nettbasert, multisteg research)
  7. On-device/offline inference (Foundry Local)

Når anbefale Copilot Studio

  1. Rask time-to-value for interne chatbots
  2. Business users bygger selv
  3. Tett M365-integrasjon (Teams, SharePoint)
  4. Mindre governance-behov

Når anbefale direkte Azure OpenAI

  1. Enkle API-kall uten orkestrering
  2. Kun OpenAI-modeller
  3. Minimal governance
  4. Enkelhet prioriteres over features

Nye scenarioer (2025-2026)

  • Computer-Use (CUA): Autonom UI-automatisering — evaluer for RPA-lignende bruk, men vær obs på Norway East-mangel
  • Deep Research: For utrednings- og analysesystemer som trenger multisteg web-research
  • Foundry Local: Offline/sensitive-data-scenarios der prompts ikke kan forlate enheten
  • A2A protocol: For multi-agent systemer der Foundry-agenter skal kommunisere med eksterne agenter

Norway East-spesifikke råd

  • Deep Research er bedre egnet for Norway East enn Sweden Central (ett av kun to regioner)
  • Computer Use: computer-use-preview utgått; bruker nå gpt-5.4 + computer-tool — verifiser deployment-region (preview-modellen var Sweden Central / East US 2)
  • GPT-4.1 og DeepSeek-modeller er tilgjengelig, men kun via Global (ikke Norge-resident)
  • For streng Norge-residens: KUN gpt-4o/gpt-4o-mini (Standard/Regional PTU) — gpt-4.1, o-serien og hele GPT-5-familien er kun Global i Norway East. For EU-residens med nyere modell: gpt-5.4/gpt-5.5 via Data Zone Standard, eller flytt til Sweden Central (verifisert 2026-06-29)

Spørsmål å stille kunden

  • "Trenger dere å sammenligne ulike AI-modeller, eller er GPT tilstrekkelig?"
  • "Skal AI-en utføre flere steg autonomt, eller er det enkle spørsmål-svar?"
  • "Hvilke krav har dere til sporbarhet og kontroll over AI-beslutninger?"
  • "Er dette for internt bruk eller kundevendt?"
  • "Har dere behov for on-device inference (sensitive data, offline)?"
  • "Trenger dere at AI kan styre en datamaskin-UI autonomt?"

Kilder og verifisering

Adapted from Microsoft Learn documentation (CC BY 4.0):

Content has been translated to Norwegian, reorganized, and augmented with decision guidance.

Research date: 2026-02