ms-ai-architect/skills/ms-ai-security/references/cost-optimization/model-selection-price-performance.md
Kjell Tore Guttormsen ddce43d8b2 feat(ms-ai-architect): Spor 1 — Port-1-substrat migrert på 4 ikke-advisor-skills (243 Source + 327 Type + 325 TOC + stale-verified poison fjernet) [skip-docs]
Steg 9 (R4): unified migrate-corpus.mjs --write over engineering/governance/
infrastructure/security. 327 filer mutert, verified=null, prosa byte-identisk
(fra første ## seksjon), advisor urørt (0 endringer).

To applier-fixes oppdaget under kjøring (TDD, RED→GREEN):
- insertHeaderFields: anker faller nå tilbake når en meta-linje selv passerer
  500B (2 filer pakket et avsnitt i **Status:** → Type/Source landet utenfor
  scan-vinduet, applierens post-write-assertion fanget + restaurerte).
- normalizeStaleVerified: fjerner nå ALLE stale non-date **Verified:** i
  500B-vinduet, inkl. stray body-dup rett under --- (9 mlops-genaiops-filer var
  ellers falskt "verified"/fresh, droppet fra worklist). Operatør-godkjent
  utvidelse av carve-out; kun stray metadata-linjer, aldri prosa.

test-transform-criterion: precondition oppdatert til post-migrasjons-sannhet
(fila bærer nå Source). Suite 728/728 grønn.
2026-07-04 10:19:11 +02:00

25 KiB
Raw Blame History

Model Selection for Cost-Efficiency

Last updated: 2026-06 Status: GA Category: Cost Optimization & FinOps for AI Source: https://learn.microsoft.com/azure/foundry/foundry-models/concepts/models-sold-directly-by-azure Type: reference


Innhold

Introduksjon

Valg av AI-modell har direkte innvirkning på både ytelse og kostnad. Microsoft Azure AI tilbyr et bredt spekter av modeller med ulike pris-/ytelsekarakteristikker — fra små, kostnadseffektive modeller som GPT-4o mini og GPT-4.1-nano, til store resonneringsmodeller som GPT-5. Riktig modellvalg kan redusere kostnader med 60-80% uten å ofre kvalitet for det aktuelle bruksområdet.

Merk (2026-06): Denne referansens modelleksempler (GPT-5 / GPT-4.1 / GPT-4o-mini) er én generasjon bak. GPT-5-generasjonen er nå utvidet til GPT-5.1→5.5 (jf. models-sold-directly-by-azure). Pris-/ytelsesprinsippene under er fortsatt gyldige, men ved konkret modellvalg: bruk den region-verifiserte model-catalog-2026.md.

Confidence: Høy (basert på offisiell Microsoft-dokumentasjon, jan 2026)

Denne referansen gir strukturert veiledning for å velge mest kostnadseffektive modell basert på:

  • Arbeidsbelastningens kompleksitet (reasoning vs. hurtige svar)
  • Latenskrav (sanntid vs. batch)
  • Volum (tokens per minutt, forespørsler per minutt)
  • Budsjettrammer

Nøkkelprinsipp: Velg den minste modellen som oppfyller kvalitetskravene dine. Større modeller = høyere kostnader per token.


Kjernekomponenter

1. Modellklasser og prisposisjonering

Microsoft Azure AI-plattformen tilbyr flere modellklasser med distinkte pris-/ytelsekarakteristikker:

Modellklasse Eksempler Bruksområde Relativ kostnad Latens
Resonneringsmodeller GPT-5, GPT-5-mini, GPT-5-nano Kompleks analyse, multi-steg logikk, planlegging Høyest Høyere
Store generelle modeller GPT-4.1, GPT-4o Balansert ytelse, generelle oppgaver Middels-høy Moderat
Små effektive modeller GPT-4.1-mini, GPT-4.1-nano, GPT-4o-mini Høyt volum, sanntid, enklere oppgaver Lavest Lavest
Spesialiserte modeller Embeddings, Whisper, DALL-E Embeddings, tale, bilder Varierer Varierer

Confidence: Høy (basert på Azure OpenAI-prisside og modellkatalog, feb 2026)

2. Token-basert prismodell

Azure OpenAI-tjenester prises per 1 000 tokens (1K) eller 1 million tokens (1M), avhengig av modell:

GPT-4o mini (eksempel — verifiser på Azure OpenAI pricing):

  • Input: ~$0.15 per 1M tokens
  • Output: ~$0.60 per 1M tokens

GPT-4.1 (eksempel):

  • Input: ~$2.00 per 1M tokens
  • Output: ~$8.00 per 1M tokens

GPT-5 (verifisert juni 2026):

  • Input: $1.25 per 1M tokens (cached $0.125)
  • Output: $10.00 per 1M tokens
  • Merk: resonnerings-tokens faktureres som output — high reasoning_effort kan øke effektiv kost vesentlig

Viktig: Rå token-priser eies av det kanoniske registeret (deterministic-cost-calculation-model.md §1.1). Sjekk alltid offisiell prisside for eksakte satser per region og modellversjon.

Confidence: Moderat (priseksempler fra dokumentasjon, men priser kan variere)

3. Deployment-typer og kostnadsimplikasjon

Deployment-type Prismodell Best for Kostnadspredikabilitet
Standard Pay-per-token Variabelt volum, testing Lav (avhenger av bruk)
Global Standard Pay-per-token (ingen data residency) Høyt volum, global tilgang Lav (avhenger av bruk)
Provisioned Throughput (PTU) Fast PTU-time-pris Forutsigbart volum, latens-SLA Høy (fast kostnad)
Developer Tier (fine-tuning) Pay-per-token, ingen hosting-fee Evaluering, POC (auto-slettes etter 24t) Lav (midlertidig)

PTU-eksempel:

  • 1 PTU = ~5 400 input tokens/minutt for o4-mini
  • 1 PTU = ~3 000 input tokens/minutt for GPT-4.1
  • PTU-pris varierer per avtale/reservasjon

Confidence: Høy (basert på Azure OpenAI deployment-dokumentasjon)

4. Fine-tuning kostnadsmønstre

Fine-tunede modeller har tre kostnadsdimensjoner:

Kostnadselement Beskrivelse Eksempel (o4-mini)
Training Per token i treningsfil ~$1.10 per 1M tokens (input), $4.40 per 1M tokens (output)
Hosting Per time deployed modell $1.70/time (Standard/Global Standard)
Inference Per token ved inferens Samme som base-modell + hosting fee

Viktig: Fine-tunede modeller påløper hosting-kostnad selv om de ikke brukes. Slett ubrukte deployments for å unngå unødvendige kostnader.

Confidence: Høy (basert på Azure OpenAI fine-tuning kostnadsdokumentasjon)


Arkitekturmønstre

Mønster 1: Model Router for dynamisk modellvalg

Konsept: Bruk Microsoft Foundry Model Router for å automatisk velge den mest kostnadseffektive modellen basert på prompt-kompleksitet.

Fordeler:

  • Opptil 60% kostnadsreduksjon vs. alltid-bruk-GPT-5
  • Automatisk ruting basert på kompleksitet
  • Ingen kodeendringer nødvendig

Implementering:

  1. Deploy Model Router i Microsoft Foundry
  2. Konfigurer underliggende modeller (f.eks. GPT-4.1-nano, GPT-4.1-mini, GPT-4.1)
  3. Model Router analyserer prompt og velger passende modell

Use case: Chatbots, kundesupport, assistenter med varierende spørsmålskompleksitet

Confidence: Høy (Model Router er GA-funksjonalitet i Microsoft Foundry)

Mønster 2: Tiered model strategy (Small → Medium → Large)

Konsept: Kaskaderende modellvalg basert på oppgavetype:

Tier Modell Bruksområde Kostnad/1M tokens (verifisert juni 2026)
Tier 1 GPT-4.1-nano Enkel triage, klassifisering, korte svar $0.10 input, $0.40 output
Tier 2 GPT-4.1-mini Moderat kompleksitet, standarddrafting $0.40 input, $1.60 output
Tier 3 GPT-4.1 / GPT-5-mini Kompleks analyse, resonnering GPT-4.1 $2.00/$8.00 · GPT-5-mini $0.25/$2.00

Implementering:

def select_model(task_complexity: str):
    if task_complexity == "simple":
        return "gpt-4.1-nano"
    elif task_complexity == "moderate":
        return "gpt-4.1-mini"
    else:
        return "gpt-5-mini"

ROI-eksempel:

  • 1 million forespørsler/måned
  • 70% simple (Tier 1), 25% moderate (Tier 2), 5% komplekse (Tier 3)
  • Estimert besparelse: 50-70% vs. alltid bruke GPT-4.1

Confidence: Høy (best practice-mønster dokumentert i Azure-veiledning)

Mønster 3: Reasoning-nivå optimalisering (GPT-5)

Konsept: For GPT-5-modeller, juster reasoning-nivå basert på oppgavekompleksitet.

Reasoning-nivå Latens Kostnad Nøyaktighet Bruksområde
Minimal Raskest Lavest Lavest Bulk-operasjoner, enkle transformasjoner
Low Rask Lav Moderat Triage, korte svar, enkle redigeringer
Medium (default) Moderat Middels God Innholdsdrafting, moderat koding, RAG Q&A
High Sakte Høyest Høyest Kompleks planlegging, analyse, multi-hop reasoning

Implementering:

response = client.responses.create(
    model="gpt-5",
    reasoning_effort="low",  # Juster basert på oppgave
    input=[{"role": "user", "content": "Simple query"}]
)

Kostnadssparepotensial: 40-60% for oppgaver som ikke krever deep reasoning.

Confidence: Høy (reasoning-nivåer er dokumentert GPT-5-funksjonalitet)

Mønster 4: Batch processing for ikke-sanntidsoppgaver

Konsept: Bruk batch-prosessering med billigere modeller for oppgaver uten sanntidskrav.

Fordeler:

  • Lavere kostnader (batch-rabatter hvis tilgjengelig)
  • Kan bruke mindre modeller med lengre behandlingstid
  • Bedre ressursutnyttelse

Use case:

  • Nattlig rapportgenerering
  • E-postsammendrag
  • Innholdsmoderering (ikke-sanntid)
  • Databearbeiding

Confidence: Moderat (batch processing er best practice, men ikke alltid prisrabattert)

Mønster 5: Prompt optimization for token-reduksjon

Konsept: Reduser token-bruk gjennom prompt-optimalisering:

Teknikk Token-besparelse Implementering
Fjern verbose instruksjoner 10-30% Konsis prompts, fjern overflødige ord
Few-shot → Zero-shot 20-50% Fjern eksempler hvis modellen håndterer det
Kontekst-komprimering 30-60% Bruk embeddings/semantic search for relevant kontekst
Output length limiting Varierer Sett max_tokens eksplisitt

ROI-eksempel:

  • Original prompt: 500 tokens input, 200 tokens output
  • Optimalisert prompt: 250 tokens input, 150 tokens output
  • Token-reduksjon: 50% input, 25% output
  • Kostnadssparing: ~40-45% per forespørsel

Confidence: Høy (token-optimalisering er best practice)


Beslutningsveiledning

Beslutningstre for modellvalg

START
  ↓
Krever oppgaven deep reasoning/multi-step logikk?
  ├─ JA → Velg GPT-5 (juster reasoning-nivå)
  └─ NEI → Er latens kritisk (< 200ms)?
       ├─ JA → Velg GPT-4.1-nano eller GPT-4.1-mini
       └─ NEI → Er oppgaven kompleks?
            ├─ JA → Velg GPT-4.1 eller GPT-4.1-mini
            └─ NEI → Velg GPT-4.1-nano (billigste)

Scenario-basert modellanbefaling

Scenario Anbefalt modell Begrunnelse
Kundesupport chatbot GPT-4.1-mini + Model Router Balanse mellom kostnad og kvalitet, dynamisk tilpasning
Kodegenerering GPT-5-mini (medium reasoning) Krever resonnering, men ikke maksimal
Dokumentanalyse (juridisk/finans) GPT-5 (high reasoning) Høy nøyaktighet viktigere enn kostnad
E-postklassifisering GPT-4.1-nano Enkel oppgave, høyt volum
RAG-basert Q&A GPT-4.1-mini Moderat kompleksitet, kontekst fra retrieval
Innholdsmoderering GPT-4.1-nano + Content Safety Høyt volum, enkel klassifisering
Enterprise Copilot GPT-5 (medium reasoning) + GPT-4.1-mini fallback Komplekse oppgaver krever resonnering, enkle bruker mini

Confidence: Høy (basert på Microsoft best practices og modellkarakteristikker)

Kvantitativ ROI-kalkulator (konseptuell)

Input:

  • Månedlig forespørselsvolum: N
  • Gjennomsnittlig input tokens: I
  • Gjennomsnittlig output tokens: O
  • Nåværende modell: M_current
  • Foreslått modell: M_new

Beregning:

Total tokens/måned = N × (I + O)
Kostnad_current = (I × pris_input_M_current + O × pris_output_M_current) × N / 1 000 000
Kostnad_new = (I × pris_input_M_new + O × pris_output_M_new) × N / 1 000 000
Månedlig besparelse (NOK) = (Kostnad_current - Kostnad_new) × USD_to_NOK

Eksempel:

  • 1M forespørsler/måned, 200 input tokens, 100 output tokens
  • Current: GPT-4.1 ($2.00 input, $8.00 output per 1M tokens)
  • New: GPT-4.1-mini ($1.00 input, $4.00 output per 1M tokens)
  • Kostnad_current = (200 × $2.00 + 100 × $8.00) × 1 / 1000 = $1 200
  • Kostnad_new = (200 × $1.00 + 100 × $4.00) × 1 / 1000 = $600
  • Besparelse: $600/måned (~6 600 NOK/måned ved USD 1 = NOK 11)

Confidence: Moderat (priseksempler er illustrative, faktiske priser varierer)


Integrasjon med Microsoft-stakken

Microsoft Foundry Model Catalog

Tilgang til modellkatalog:

  1. Gå til Microsoft Foundry
  2. Velg Model Catalog i venstre meny
  3. Filtrer på "Azure OpenAI" for Microsoft-modeller
  4. Sammenlign modeller basert på:
    • Input/output token-priser
    • Context window size
    • Capabilities (vision, function calling, etc.)
    • Regional tilgjengelighet

Confidence: Høy (Microsoft Foundry er GA)

Azure Cost Management + Budgets

Integrasjon for kostnadssporing:

Funksjon Beskrivelse Verdi
Cost Analysis Per-modell kostnadsinnsikt via deployment tags Identifiser dyreste modeller
Budgets + Alerts Varsler ved kostnadsterskler Forhindre budsjettoverskridelser
Export til Storage Daglig/ukentlig kostnadseksport Dypere analyse i Power BI/Excel

Implementering:

  1. Gå til Azure Portal → Cost Management
  2. Opprett budget scoped til resource group
  3. Sett alerts ved 50%, 75%, 90% av budsjett
  4. Grupper kostnader etter "Meter" for å se per-modell kostnad

Confidence: Høy (Cost Management er standard Azure-funksjonalitet)

Power Platform AI Builder

Modellvalg i AI Builder:

  • AI Builder / prompt builder bruker GPT-4.1 mini som standardmodell for generative oppgaver (GPT-4o mini og GPT-4o brukes nå kun i US government-regioner)
  • Ingen direkte modellvalg tilgjengelig i AI Builder-grensesnittet
  • Kostnader inkludert i AI Builder credits (500 credits/bruker/måned i premium-planer)

Optimalisering:

  • Begrens prompt-lengde
  • Bruk structured outputs for å redusere token-bruk

Confidence: Moderat (basert på Power Platform dokumentasjon)

Copilot Studio

Modellstrategi i Copilot Studio:

  • Copilot Studio bruker Azure OpenAI-modeller (GPT-4o eller GPT-4.1-serien)
  • Licenskostnad dekker inferenskostnader (per Q2 2024)
  • Vurder Generative Answers vs. custom topics for kostnadskontroll

Optimalisering:

  • Bruk Boosted Conversations kun når nødvendig
  • Optimaliser Generative Answers med tydelige fallback-scenarier

Confidence: Moderat (Copilot Studio-lisensiering kan endre seg)


Offentlig sektor (Norge)

Kostnadskontroll i offentlige anskaffelser

Krav til kostnadstransparens:

  • Offentlige virksomheter må kunne dokumentere kostnader per tjeneste/bruker
  • Azure Cost Management gir nødvendig sporbarhet
  • Tagging-strategi anbefales: project, department, cost-center

Anbefaling:

  • Etabler månedlig kostnadsrapportering per prosjekt
  • Bruk PTU (Provisioned Throughput) for forutsigbare budsjetter i produksjon
  • Test med Standard deployment, migrer til PTU ved stabil bruk

Confidence: Høy (basert på generell offentlig sektor best practice)

Compliance og dataplassering

Kostnad vs. compliance:

  • Standard deployment (regional): Høyere kostnad, garantert data residency i Norge
  • Global Standard: Lavere kostnad, ingen data residency-garanti

Anbefaling for offentlig sektor:

  • Velg Standard deployment i Norway East for personopplysninger (GDPR)
  • Vurder Global Standard for ikke-sensitive workloads (potensielt 10-20% billigere)

Confidence: Høy (basert på Azure OpenAI deployment-dokumentasjon)

TCO for offentlig AI-satsning

Total Cost of Ownership-komponenter:

Kostnadselement Estimat (årlig, små prosjekter) Optimalisering
Azure OpenAI inferens 50 000 - 200 000 NOK Modellvalg, prompt-optimalisering
Azure AI Search (RAG) 30 000 - 100 000 NOK Indeksoptimalisering, partitioning
Azure Storage 5 000 - 20 000 NOK Lifecycle policies
Azure Monitor/App Insights 10 000 - 30 000 NOK Sampling, log retention
Lisenser (Copilot Studio) 200 - 2 000 NOK/bruker/måned Pilot med få brukere først

Total estimert TCO (små prosjekter): 100 000 - 500 000 NOK/år (ekskl. personellkostnader)

Confidence: Lav-Moderat (estimater er generelle, varierer betydelig per use case)


Kostnad og lisensiering

Lisensmodeller for Microsoft AI

Produkt Lisensmodell AI-kostnad inkludert? Ekstra kostnad
Azure OpenAI Pay-per-token eller PTU Nei Basert på bruk eller PTU-reservasjon
Copilot Studio Per bruker/måned (~$200/måned) Ja (inferens inkludert) Økt bruk kan koste ekstra
Power Platform (premium) Per bruker/måned (~$40/bruker) Delvis (500 AI Builder credits/bruker) Ytterligere credits må kjøpes
M365 Copilot Per bruker/måned (~$360/bruker) Ja (inferens inkludert) Ingen ekstra kostnad

Viktig: Priser er illustrative per januar 2026. Verifiser på Microsoft lisensside.

Confidence: Moderat (lisenser endres regelmessig)

Cost avoidance-strategier

Strategi Potensial besparelse Kompleksitet
Bytt fra GPT-4.1 til GPT-4.1-mini 50% Lav (krever testing)
Bruk Model Router 30-60% Middels (Microsoft Foundry-setup)
Prompt-optimalisering 20-40% Lav (kan gjøres iterativt)
Fine-tuning for å erstatte større modell 40-70% Høy (krever treningsdata og vedlikehold)
Migrering til PTU (ved høyt volum) 20-50% Middels (krever volumprediksjon)
Caching (for repeterende prompts) 10-30% Lav-Middels (krever cache-logikk)

Confidence: Moderat (besparelsespotensial varierer per use case)

Regional prisvariasjoner

Eksempel (verifiser på Azure-prisside):

  • Norway East: Standard pricing
  • West Europe: Standard pricing
  • East US: ~5-10% billigere (ikke-europeisk region)

Anbefaling for norske virksomheter:

  • Bruk Norway East for compliance-sensitive data
  • Vurder West Europe for ikke-sensitive workloads (latens vs. kostnad)

Confidence: Moderat (prisvariasjon finnes, men er ofte marginal)


For arkitekten (Cosmo)

Når bruke denne referansen

Triggers:

  • Bruker spør: "Hvilken modell bør jeg bruke for [use case]?"
  • Bruker ønsker kostnadsoptimalisering av eksisterende løsning
  • Bruker planlegger høyvolum-deployment og er bekymret for kostnad
  • Bruker vil sammenligne GPT-4o-mini vs. GPT-4.1 vs. GPT-5

Rådgivningsprosess

1. Forstå use case:

  • Hva skal modellen gjøre? (klassifisering, generering, resonnering)
  • Hva er volumet? (forespørsler/dag, tokens per forespørsel)
  • Hva er latenskrav? (sanntid vs. batch)

2. Foreslå modellstrategi:

  • Bruk beslutningstreet i "Beslutningsveiledning"
  • Anbefal tiered approach hvis varierende kompleksitet
  • Vurder Model Router for dynamisk ruting

3. Estimer kostnader:

  • Bruk ROI-kalkulatoren (konseptuell seksjon)
  • Sammenlign nåværende vs. foreslått modell
  • Inkluder TCO (ikke bare inferenskostnad)

4. Anbefal testing:

  • "Start med GPT-4.1-mini, evaluer kvalitet"
  • "Opprett evaluation dataset for sammenligning"
  • "Test i 1-2 uker før full rollout"

5. Oppfølging:

  • Sett opp Cost Management alerts
  • Følg opp med Azure Monitor for ytelsesmetrikker
  • Juster modellvalg basert på faktisk bruk

Typiske spørsmål og svar

Q: "Skal jeg alltid bruke billigste modell?" A: Nei. Velg den minste modellen som oppfyller kvalitetskravene. Hvis GPT-4.1-nano gir 70% kvalitet men GPT-4.1-mini gir 95%, kan ekstra kostnad være verdt det.

Q: "Hvordan vet jeg om GPT-4.1-mini er god nok vs. GPT-4.1?" A: Opprett et evaluation dataset (50-100 representative eksempler), kjør begge modeller, sammenlign output. Bruk Microsoft Foundry evaluations for strukturert testing.

Q: "Er fine-tuning alltid billigere?" A: Nei. Fine-tuning har opfront-kostnad (training) og hosting-kostnad ($1.70/time). Kun kostnadseffektivt ved høyt volum (>100K forespørsler/måned) eller hvis du kan erstatte GPT-4.1 med fine-tuned GPT-4.1-mini.

Q: "Hvordan optimalisere kostnader for RAG-løsning?" A:

  1. Bruk semantic search for å redusere kontekst-tokens
  2. Velg GPT-4.1-mini for spørsmål med god retrieval
  3. Fallback til GPT-4.1 hvis ikke confident svar
  4. Optimaliser chunking-strategi i Azure AI Search

Confidence markers i rådgivning

Bruk alltid confidence markers når du anbefaler modeller:

  • Høy confidence: "GPT-4.1-mini er dokumentert 50% billigere enn GPT-4.1 for samme deployment-type."
  • Moderat confidence: "Basert på lignende use cases, forventer jeg 30-50% kostnadsreduksjon."
  • Lav confidence: "Uten å teste på ditt spesifikke dataset, er det vanskelig å si om GPT-4.1-nano vil være tilstrekkelig."

Verktøy for kostnadsestimering

Anbefal alltid:

  1. Azure Pricing Calculator for estimering
  2. Microsoft Foundry Calculator for PTU-estimering
  3. Azure Cost Management for faktisk kostnadssporing

Vanlige fallgruver

Fallgruve Konsekvens Hvordan unngå
Alltid bruke GPT-5 3-5x høyere kostnad Vurder GPT-4.1-mini eller GPT-4.1 først
Glemme hosting-kostnad for fine-tuning $1.70/time × 24 × 30 = $1 224/måned Slett ubrukte fine-tuned deployments
Ikke sette max_tokens Unødvendig lange svar = høyere output-kostnad Sett max_tokens eksplisitt
Bruke Standard over Global Standard uten grunn 10-20% høyere kostnad Velg Global Standard hvis data residency ikke kreves
Ikke monitere kostnader Uventede regninger Sett opp Cost Management alerts

Kilder og verifisering

Primærkilder (Microsoft Learn)

  1. GPT-5 vs GPT-4.1: choosing the right model for your use case URL: https://learn.microsoft.com/en-us/azure/foundry/foundry-models/how-to/model-choice-guide?view=foundry-classic Hentet: 2026-02 Innhold: Modellsammenligninger, latency trade-offs, reasoning-nivåer

  2. Plan to manage costs for Azure OpenAI in Foundry Models URL: https://learn.microsoft.com/en-us/azure/foundry/concepts/manage-costs Hentet: 2026-02 Innhold: Billing models, token pricing, cost monitoring

  3. Cost management for fine-tuning URL: https://learn.microsoft.com/en-us/azure/foundry/openai/how-to/fine-tuning-cost-management?view=foundry-classic Hentet: 2026-02 Innhold: Training costs, hosting costs, deployment types

  4. Optimize model cost and performance URL: https://learn.microsoft.com/en-us/azure/foundry/control-plane/how-to-optimize-cost-performance?view=foundry Hentet: 2026-02 Innhold: Model Router, cost optimization workflows

  5. Azure OpenAI in Foundry Models URL: https://learn.microsoft.com/en-us/azure/foundry/foundry-models/concepts/models-sold-directly-by-azure Hentet: 2026-02 Innhold: Model catalog, capabilities, regional availability

  6. Understanding costs associated with provisioned throughput units (PTU) URL: https://learn.microsoft.com/en-us/azure/foundry/openai/concepts/provisioned-throughput-billing Hentet: 2026-02 Innhold: PTU pricing, throughput per PTU, when to use PTU

Sekundærkilder

  1. Azure OpenAI Pricing Page URL: https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/ Note: Offisiell prisside (sjekk for oppdaterte priser)

  2. Azure Pricing Calculator URL: https://azure.microsoft.com/pricing/calculator/ Note: For pre-deployment estimering

  3. Microsoft Foundry Calculator URL: https://ai.azure.com/resource/calculator Note: For PTU-estimering

Verifiseringsstatus

Påstand Kilde Confidence
GPT-4.1-mini er 50% billigere enn GPT-4.1 Source 2, illustrative pricing examples Høy
Model Router kan spare opptil 60% Source 4 Høy
Fine-tuning hosting cost er $1.70/time Source 3 Høy
GPT-5 har fire reasoning-nivåer Source 1 Høy
PTU gir 3 000 input TPM per PTU for GPT-4.1 Source 6 Høy

Totalt antall kilder: 9 (6 primære Microsoft Learn-artikler, 3 pricing-referanser) MCP-kall brukt: 6 (4x docs_search, 2x docs_fetch)

Siste oppdatering og gyldighet

Dokumentasjonsdato: Januar-februar 2026; modell-enumerasjon oppdatert 2026-06 Priser gyldige per: Februar 2026 (illustrative — verifiser alltid på offisiell prisside) Modeller i GA (per 2026-06): GPT-4.1-serien, GPT-4o/GPT-4o-mini, o-serien (o1/o3/o3-mini/o4-mini), og GPT-5-generasjonen: GPT-5/-mini/-nano (2025-08), GPT-5.1 (2025-11-13), GPT-5.2 (2025-12-11), GPT-5.3-codex/-chat (2026-02/03), GPT-5.4 + GPT-5.4-pro (2026-03-05), GPT-5.5 (2026-04-24), gpt-chat-latest (2026-05, preview). Snapshotten over (GPT-5 / GPT-4.1 / GPT-4o-mini) er én generasjon bak — GPT-5.1→5.5 finnes nå. Full, region-verifisert modellkatalog: model-catalog-2026.md. Neste review anbefalt: Q4 2026 (Microsoft oppdaterer priser kvartalsvis)


Dokumenteier: Cosmo Skyberg, Microsoft AI Solution Architect Godkjent for: Offentlig sektor Norge, Enterprise Azure-kunder Versjon: 1.0