ms-ai-architect/skills/ms-ai-advisor/references/platforms/azure-ai-foundry.md
Kjell Tore Guttormsen baa2d0220b feat(ultraplan-local): v1.6.0 — /ultraresearch-local deep research command
Add /ultraresearch-local for structured research combining local codebase
analysis with external knowledge via parallel agent swarms. Produces research
briefs with triangulation, confidence ratings, and source quality assessment.

New command: /ultraresearch-local with modes --quick, --local, --external, --fg.
New agents: research-orchestrator (opus), docs-researcher, community-researcher,
security-researcher, contrarian-researcher, gemini-bridge (all sonnet).
New template: research-brief-template.md.

Integration: --research flag in /ultraplan-local accepts pre-built research
briefs (up to 3), enriches the interview and exploration phases. Planning
orchestrator cross-references brief findings during synthesis.

Design principle: Context Engineering — right information to right agent at
right time. Research briefs are structured artifacts in the pipeline:
ultraresearch → brief → ultraplan --research → plan → ultraexecute.

Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>
2026-04-08 08:58:35 +02:00

16 KiB

Azure AI Foundry (Microsoft Foundry) - Knowledge Base

Last updated: 2026-02 (research via microsoft-learn MCP) Status: GA (General Availability) — rebrandet til Microsoft Foundry desember 2025


Hva er Microsoft Foundry?

NB: Plattformen heter nå Microsoft Foundry. Azure AI Foundry er rebrandet (desember 2025). Dokumentasjonen sier eksplisitt: "Azure AI Foundry is now Microsoft Foundry." Portalen finnes fortsatt på https://ai.azure.com.

Microsoft Foundry er Microsofts unified platform-as-a-service for enterprise AI-operasjoner, modellbygging og applikasjonsutvikling. Plattformen ble opprinnelig lansert ved Ignite 2024 som etterfølger til Azure AI Studio.

To portaler:

  • Microsoft Foundry (classic) — støtter alle resource types: Azure OpenAI, hub-baserte prosjekter, Foundry-prosjekter
  • Microsoft Foundry (new) — kun Foundry-prosjekter, optimalisert for multi-agent-applikasjoner

Nøkkeltall:

  • 1,900+ modeller "sold directly by Azure" (frontier models)
  • 11,000+ totalt i katalogen
  • 40+ Azure-regioner

Konsept: Microsoft posisjonerer Foundry som en "agent factory" — standardiserte komponenter og prosesser for å bygge intelligente systemer.


Hvordan skiller Foundry seg fra forgjengerne?

Plattform Fokus Status
Azure OpenAI Studio Direkte tilgang til OpenAI-modeller Konsolidert inn i Foundry
Azure AI Studio Generativ AI-utvikling Rebrandet til Foundry
Azure Machine Learning Tradisjonell ML, custom models Lever videre, komplementær

Foundry konsoliderer de tre førstnevnte til én plattform, mens Azure ML forblir separat for tradisjonell maskinlæring.


Kjernekomponenter

1. Foundry Models

Katalog med 1,900+ modeller solgt direkte av Azure, pluss community/partner-modeller:

  • OpenAI: GPT-5-serien (gpt-5, gpt-5-mini, gpt-5-nano, gpt-5-chat, gpt-5-codex, gpt-5-pro), GPT-4.1-serien (gpt-4.1, gpt-4.1-mini, gpt-4.1-nano), GPT-4o, o3, o4-mini
  • Anthropic: Claude-modeller (via marketplace)
  • Meta: Llama 4 (Maverick 17B), Llama 3.3-70B
  • DeepSeek: DeepSeek-R1, DeepSeek-V3-0324, DeepSeek-R1-0528, DeepSeek-V3.1
  • xAI: Grok-4, Grok-3, Grok-3-mini
  • Mistral: Mistral-document-ai og andre
  • Spesialiserte: Vision, audio, domene-spesifikke

GPT-5-serien (GA august 2025)

Modell Context Max output Tilgang
gpt-5 (2025-08-07) 400K (input 272K) 128K Krever registrering
gpt-5-mini (2025-08-07) 400K 128K Åpen
gpt-5-nano (2025-08-07) 400K 128K Åpen
gpt-5-chat (2025-08-07) 128K 16,384 Åpen (Preview)
gpt-5-codex (2025-09-11) 400K 128K Krever registrering
gpt-5-pro (2025-10-06) 400K 128K Registrering

GPT-5 støtter reasoning, Chat Completions API, Responses API, structured outputs, text/image input, parallel tool calling.

GPT-4.1-serien (GA april 2025)

Modell Kontekst Merknad
gpt-4.1 (2025-04-14) 1 million tokens Lengste kontekst, 4 input = 1 output PTU-ratio
gpt-4.1-mini (2025-04-14) Standard Balansert pris/ytelse
gpt-4.1-nano (2025-04-14) Standard Lavest pris, 59,400 TPM per PTU

Alle GPT-4.1-modeller tilgjengelige i Norway East.

DeepSeek-modeller (Foundry Models sold directly by Azure)

Modell Type Context
DeepSeek-R1 Reasoning 163,840 tokens
DeepSeek-V3 (Legacy) MoE 131,072 tokens
DeepSeek-V3-0324 MoE 131,072 tokens
DeepSeek-R1-0528 Reasoning 131,072 tokens
DeepSeek-V3.1 MoE 131,072 tokens

DeepSeek-modeller er tilgjengelige i Norway East.

2. Foundry Agent Service

Status: GA (mai 2025)

Managed runtime for å bygge multi-agent systemer:

  • Persistent workflows
  • Error recovery
  • Inter-agent kommunikasjon
  • Innebygd tilgang til SharePoint, Fabric, Bing, AI Search
  • 1,400+ Logic Apps connectors
  • Azure Logic Apps-triggere (automatisk invokasjon ved hendelser)
  • Tracing og debugging av agent-tråder
  • VS Code-extension (Microsoft Foundry for VS Code)

Post-GA tillegg (juni 2025):

  • MCP tool — agenter kobler til remote Model Context Protocol-servere. Autentisering med Microsoft Entra ID (AgenticIdentityToken).
  • Deep Research tool — se egen seksjon
  • A2A tool (preview) — Agent-to-Agent kommunikasjon via standardisert A2A-protokoll (a2a-protocol.org). Primæragenten beholder kontroll; subagentens svar returneres tilbake.

Viktig skilnad A2A vs Workflows:

  • A2A tool: Agent A kaller Agent B, får svar tilbake, Agent A fortsetter
  • Workflows: Agent A kaller Agent B, Agent B tar over ansvaret for brukeren

3. Foundry Workflows (visuell multi-agent orkestrering)

Status: Tilgjengelig (erstatter Connected agents-API fra 2025-05-15-preview)

UI-basert verktøy for å lage deklarative, forhåndsdefinerte sekvenser av handlinger:

  • Visuell builder i Microsoft Foundry-portalen
  • Branching-logikk (if/else) og variabelhåndtering uten kode
  • Human-in-the-loop-steg (godkjenninger, avklarende spørsmål)
  • YAML-basert konfigurasjon — kan redigeres i VS Code
  • To modes: Declarative (Low-code) og Hosted (Pro-code)
  • Versjonering, change logs, visuell monitorering
  • Egnet for: multisteg godkjenningsprosesser, compliance-innsamling, incident triage, ETL

4. Foundry Local (on-device inference)

Status: Preview

Fullverdig on-device AI inference:

  • Kjører AI-modeller lokalt via CLI, SDK eller REST API
  • OpenAI-kompatibelt REST API (dynamisk port)
  • ONNX Runtime med støtte for CPU, GPU, NPU (Intel, AMD, Qualcomm)
  • Model cache — modeller lastes ned én gang, brukes offline
  • Krever ikke Azure-abonnement for inference
  • Prompts forblir på enheten (nettverkstrafikk kun ved modell-nedlasting)
  • SDK: Python, JavaScript, C# (WinML for Windows, cross-platform), Rust
  • AI Toolkit for VS Code-integrasjon
  • Eksempel: foundry model run qwen2.5-0.5b
  • Begrensning: Ikke for distribuert/produksjons-/multi-machine-deployment

5. Computer-Using Agents (CUA)

Status: Preview (registrering påkrevd)

computer-use-preview-modellen (2025-03-11) via Responses API:

  • Autonom navigasjon: klikker knapper, fyller skjemaer, navigerer multi-page workflows
  • Dynamisk tilpasning til UI-endringer
  • Cross-application (web og desktop)
  • Natural language interface
  • Regioner: East US 2, Sweden Central, South India — IKKE Norway East
  • Kontekstvindu: 8,192 tokens, maks output: 1,024 tokens
  • Registrering: https://aka.ms/oai/cuaaccess

6. Deep Research tool

Status: Preview (juni 2025)

Multisteg web-research integrert i Foundry Agent Service:

  • Modell: o3-deep-research (2025-06-26)
  • Regioner: Kun West US og Norway East (bare disse to)
  • Grounding med Bing Search (Grounding with Bing Search resource påkrevd)
  • Multisteg reasoning: åpner og leser mange sider, syntetiserer til citation-rich rapport
  • Bruker gpt-4o for å avklare research-scope
  • Fra API 2025-11-15-preview: kan bruke MCP-servere som intern datakilde
  • Kvoter: Enterprise 30K RPS / 30M TPM, Default 3K RPS / 3M TPM

7. Foundry Tools

Pre-built AI-tjenester:

  • Speech: Speech-to-text (gpt-4o-transcribe), text-to-speech, Realtime API (GA august 2025)
  • Vision: Image/video analyse, OCR, Sora (video generation, kun East US 2 og Sweden Central)
  • Language: Sentiment, NER, key phrase extraction
  • Document Intelligence: Strukturert data fra dokumenter
  • Translator: 100+ språk
  • Content Safety: PII-deteksjon (innebygd content filter fra oktober 2025)

8. Model Router

Intelligent routing som velger optimal modell basert på:

  • Prompt-kompleksitet
  • Reasoning-krav
  • Task type

Modi:

  • Balanced (default): Kostnadseffektiv innenfor 1-2% kvalitetsband
  • Quality: Beste modell uavhengig av kostnad
  • Cost: Aksepterer 5-6% kvalitetsvarians for lavest kostnad

Støtter GPT-5-serien, Claude Opus, Llama, DeepSeek, Grok og 18+ modeller.

9. SDK

Tilgjengelig i:

  • Python
  • C#
  • JavaScript
  • Java (begrenset — A2A tool støttes ikke i Java SDK)

Når velge hva?

Azure AI Foundry vs Copilot Studio

Dimensjon Copilot Studio Azure AI Foundry
Målgruppe Business users, citizen devs Developers, data scientists
Tilnærming Low-code, drag-and-drop Code-first, SDK
Modeller Primært GPT 1,900+ frontier + 11,000+ totalt
Governance Begrenset Enterprise-grade
Integrasjon M365-fokusert Bred Azure/enterprise
Use case Interne chatbots, IT helpdesk Forretningskritiske AI-systemer

Anbefaling: Komplementære, ikke konkurrerende. Bruk Copilot Studio for rask prototyping internt, Foundry for produksjonskritiske systemer.

Azure AI Foundry vs Direkte Azure OpenAI

Scenario Anbefaling
Kun OpenAI API-kall, minimal orkestrering Direkte Azure OpenAI
Multi-model sammenligning Foundry
Agenter med multi-step orkestrering Foundry
Enterprise governance krav Foundry
Planlegger skalering Foundry

Nøkkelinnsikt: Foundry inkluderer Azure OpenAI uten ekstra plattformkostnad.

Azure AI Foundry vs Azure Machine Learning

Behov Plattform
Trene custom models på egne data Azure ML
Orkestrere pre-built frontier models Foundry
Prediction (klassifisering, regresjon) Azure ML
Generativ AI og agenter Foundry

Mange bruker begge: Azure ML for data-pipeline og custom models, Foundry for generativ AI lag oppå.


Prising

Hovedprinsipper

  • Plattformen selv er gratis — ingen plattformavgift
  • Betaler for faktisk bruk: modeller, compute, tjenester
  • Token-basert for inference (input/output tokens) — priset per million tokens
  • Model Router kan optimalisere kostnader automatisk

Priskomponenter

  1. Model inference: Per million tokens (varierer per modell)
  2. Fine-tuning: Per token i treningsdata + hosting-timer etter deployment
  3. Managed compute: Per-minutt for dedicated instanser
  4. Agent Service: Underliggende modellbruk + Logic Apps connector-kostnader
  5. Deep Research: Bing Search tool-kall + o3-deep-research tokens
  6. Storage, monitoring, etc.: Standard Azure-priser

PTU-ratio (throughput estimation)

  • GPT-5: 1 output token = 8 input tokens
  • GPT-4.1: 1 output token = 4 input tokens
  • Bruk Foundry PTU quota calculator for estimering

Kostnadsoptimalisering

  • Bruk Model Router i "Cost" mode for høyvolum
  • Velg mindre modeller (gpt-5-mini vs gpt-5, gpt-4.1-nano vs gpt-4.1) for enklere oppgaver
  • Serverless for variable workloads, managed compute for stabile
  • Offisiell prising: https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/

Regional tilgjengelighet

Anbefalte regioner (mest komplett feature-set)

  • East US 2
  • Sweden Central
  • West US / West US 3

Nordiske regioner

Sweden Central:

  • Full feature coverage
  • Azure OpenAI (alle modeller)
  • GPT-4.1-serien, GPT-5-serien
  • DeepSeek-R1/V3, Grok-4, Llama 4
  • Speech, Language, Vision, Document Intelligence
  • Content Safety, Agent Service (GA)
  • Foundry Workflows, Prompt Flow, Tracing
  • Sora video generation
  • Computer-Use (computer-use-preview) — JA
  • Realtime API (GA)

Norway East:

  • God dekning — bredere enn tidligere dokumentert
  • Azure OpenAI: GPT-4o, GPT-4.1-serien, o3, o4-mini, o3-mini, o1
  • DeepSeek-R1, DeepSeek-V3-0324, DeepSeek-R1-0528 (Foundry Models)
  • Grok-4, Llama-modeller
  • Foundry Agent Service (GA)
  • Foundry Workflows
  • Deep Research (o3-deep-research) — Norway East er ett av kun TO regioner globalt
  • Responses API (bekreftet)
  • IKKE tilgjengelig i Norway East:
    • Computer-Use (computer-use-preview) — kun East US 2, Sweden Central, South India
    • Sora video generation — kun East US 2 og Sweden Central
    • GPT-image-1 — begrenset tilgang

On-Device / Edge

Foundry Local (Preview) støtter full on-device inference:

  • Windows (WinML, NPU-akselerasjon), Linux, macOS
  • Lokale LLMs via CLI, SDK, REST API
  • Krever ikke Azure-abonnement
  • Ikke for distribuert produksjonsdeployment

Arkitekturprinsipper

Resource-struktur

Microsoft.CognitiveServices/account (kind: AIServices)
├── Foundry resource (top-level)
│   ├── Projects (development containers)
│   ├── Deployments (model endpoints)
│   └── Connections (Key Vault, Storage, MCP-servere, etc.)

Separasjon av concerns

  • Management operations: Sikkerhet, connectivity, deployments → Top-level resource
  • Development activities: Agenter, filer, evalueringer → Project scope
  • Agent identities: Unpublished agents bruker shared project-identity; published agents får unik identitet (Entra ID)

Networking

  • Private endpoints støttet
  • VNet integration
  • Container injection for agent-kommunikasjon med on-prem systemer

For Cosmo: Beslutningsveiledning

Når anbefale Foundry

  1. Multi-model behov (OpenAI + DeepSeek + Grok + Llama)
  2. Multi-agent orkestrering — spesielt med Foundry Workflows
  3. Regulerte industrier (governance-krav, RBAC, private endpoints)
  4. Forretningskritiske AI-systemer
  5. Langsiktig AI-satsing med skaleringsplaner
  6. Deep Research-behov (nettbasert, multisteg research)
  7. On-device/offline inference (Foundry Local)

Når anbefale Copilot Studio

  1. Rask time-to-value for interne chatbots
  2. Business users bygger selv
  3. Tett M365-integrasjon (Teams, SharePoint)
  4. Mindre governance-behov

Når anbefale direkte Azure OpenAI

  1. Enkle API-kall uten orkestrering
  2. Kun OpenAI-modeller
  3. Minimal governance
  4. Enkelhet prioriteres over features

Nye scenarioer (2025-2026)

  • Computer-Use (CUA): Autonom UI-automatisering — evaluer for RPA-lignende bruk, men vær obs på Norway East-mangel
  • Deep Research: For utrednings- og analysesystemer som trenger multisteg web-research
  • Foundry Local: Offline/sensitive-data-scenarios der prompts ikke kan forlate enheten
  • A2A protocol: For multi-agent systemer der Foundry-agenter skal kommunisere med eksterne agenter

Norway East-spesifikke råd

  • Deep Research er bedre egnet for Norway East enn Sweden Central (ett av kun to regioner)
  • Computer-Use krever deployment til Sweden Central eller East US 2
  • GPT-4.1 og DeepSeek-modeller er fullt tilgjengelig

Spørsmål å stille kunden

  • "Trenger dere å sammenligne ulike AI-modeller, eller er GPT tilstrekkelig?"
  • "Skal AI-en utføre flere steg autonomt, eller er det enkle spørsmål-svar?"
  • "Hvilke krav har dere til sporbarhet og kontroll over AI-beslutninger?"
  • "Er dette for internt bruk eller kundevendt?"
  • "Har dere behov for on-device inference (sensitive data, offline)?"
  • "Trenger dere at AI kan styre en datamaskin-UI autonomt?"

Kilder og verifisering

Adapted from Microsoft Learn documentation (CC BY 4.0):

Content has been translated to Norwegian, reorganized, and augmented with decision guidance.

Research date: 2026-02