Steg 9 (R4): unified migrate-corpus.mjs --write over engineering/governance/ infrastructure/security. 327 filer mutert, verified=null, prosa byte-identisk (fra første ## seksjon), advisor urørt (0 endringer). To applier-fixes oppdaget under kjøring (TDD, RED→GREEN): - insertHeaderFields: anker faller nå tilbake når en meta-linje selv passerer 500B (2 filer pakket et avsnitt i **Status:** → Type/Source landet utenfor scan-vinduet, applierens post-write-assertion fanget + restaurerte). - normalizeStaleVerified: fjerner nå ALLE stale non-date **Verified:** i 500B-vinduet, inkl. stray body-dup rett under --- (9 mlops-genaiops-filer var ellers falskt "verified"/fresh, droppet fra worklist). Operatør-godkjent utvidelse av carve-out; kun stray metadata-linjer, aldri prosa. test-transform-criterion: precondition oppdatert til post-migrasjons-sannhet (fila bærer nå Source). Suite 728/728 grønn.
25 KiB
Model Selection for Cost-Efficiency
Last updated: 2026-06 Status: GA Category: Cost Optimization & FinOps for AI Source: https://learn.microsoft.com/azure/foundry/foundry-models/concepts/models-sold-directly-by-azure Type: reference
Innhold
- Introduksjon
- Kjernekomponenter
- Arkitekturmønstre
- Beslutningsveiledning
- Integrasjon med Microsoft-stakken
- Offentlig sektor (Norge)
- Kostnad og lisensiering
- For arkitekten (Cosmo)
- Kilder og verifisering
Introduksjon
Valg av AI-modell har direkte innvirkning på både ytelse og kostnad. Microsoft Azure AI tilbyr et bredt spekter av modeller med ulike pris-/ytelsekarakteristikker — fra små, kostnadseffektive modeller som GPT-4o mini og GPT-4.1-nano, til store resonneringsmodeller som GPT-5. Riktig modellvalg kan redusere kostnader med 60-80% uten å ofre kvalitet for det aktuelle bruksområdet.
Merk (2026-06): Denne referansens modelleksempler (GPT-5 / GPT-4.1 / GPT-4o-mini) er én generasjon bak. GPT-5-generasjonen er nå utvidet til GPT-5.1→5.5 (jf.
models-sold-directly-by-azure). Pris-/ytelsesprinsippene under er fortsatt gyldige, men ved konkret modellvalg: bruk den region-verifisertemodel-catalog-2026.md.
Confidence: Høy (basert på offisiell Microsoft-dokumentasjon, jan 2026)
Denne referansen gir strukturert veiledning for å velge mest kostnadseffektive modell basert på:
- Arbeidsbelastningens kompleksitet (reasoning vs. hurtige svar)
- Latenskrav (sanntid vs. batch)
- Volum (tokens per minutt, forespørsler per minutt)
- Budsjettrammer
Nøkkelprinsipp: Velg den minste modellen som oppfyller kvalitetskravene dine. Større modeller = høyere kostnader per token.
Kjernekomponenter
1. Modellklasser og prisposisjonering
Microsoft Azure AI-plattformen tilbyr flere modellklasser med distinkte pris-/ytelsekarakteristikker:
| Modellklasse | Eksempler | Bruksområde | Relativ kostnad | Latens |
|---|---|---|---|---|
| Resonneringsmodeller | GPT-5, GPT-5-mini, GPT-5-nano | Kompleks analyse, multi-steg logikk, planlegging | Høyest | Høyere |
| Store generelle modeller | GPT-4.1, GPT-4o | Balansert ytelse, generelle oppgaver | Middels-høy | Moderat |
| Små effektive modeller | GPT-4.1-mini, GPT-4.1-nano, GPT-4o-mini | Høyt volum, sanntid, enklere oppgaver | Lavest | Lavest |
| Spesialiserte modeller | Embeddings, Whisper, DALL-E | Embeddings, tale, bilder | Varierer | Varierer |
Confidence: Høy (basert på Azure OpenAI-prisside og modellkatalog, feb 2026)
2. Token-basert prismodell
Azure OpenAI-tjenester prises per 1 000 tokens (1K) eller 1 million tokens (1M), avhengig av modell:
GPT-4o mini (eksempel — verifiser på Azure OpenAI pricing):
- Input: ~$0.15 per 1M tokens
- Output: ~$0.60 per 1M tokens
GPT-4.1 (eksempel):
- Input: ~$2.00 per 1M tokens
- Output: ~$8.00 per 1M tokens
GPT-5 (verifisert juni 2026):
- Input: $1.25 per 1M tokens (cached $0.125)
- Output: $10.00 per 1M tokens
- Merk: resonnerings-tokens faktureres som output —
highreasoning_effort kan øke effektiv kost vesentlig
Viktig: Rå token-priser eies av det kanoniske registeret (deterministic-cost-calculation-model.md §1.1). Sjekk alltid offisiell prisside for eksakte satser per region og modellversjon.
Confidence: Moderat (priseksempler fra dokumentasjon, men priser kan variere)
3. Deployment-typer og kostnadsimplikasjon
| Deployment-type | Prismodell | Best for | Kostnadspredikabilitet |
|---|---|---|---|
| Standard | Pay-per-token | Variabelt volum, testing | Lav (avhenger av bruk) |
| Global Standard | Pay-per-token (ingen data residency) | Høyt volum, global tilgang | Lav (avhenger av bruk) |
| Provisioned Throughput (PTU) | Fast PTU-time-pris | Forutsigbart volum, latens-SLA | Høy (fast kostnad) |
| Developer Tier (fine-tuning) | Pay-per-token, ingen hosting-fee | Evaluering, POC (auto-slettes etter 24t) | Lav (midlertidig) |
PTU-eksempel:
- 1 PTU = ~5 400 input tokens/minutt for o4-mini
- 1 PTU = ~3 000 input tokens/minutt for GPT-4.1
- PTU-pris varierer per avtale/reservasjon
Confidence: Høy (basert på Azure OpenAI deployment-dokumentasjon)
4. Fine-tuning kostnadsmønstre
Fine-tunede modeller har tre kostnadsdimensjoner:
| Kostnadselement | Beskrivelse | Eksempel (o4-mini) |
|---|---|---|
| Training | Per token i treningsfil | ~$1.10 per 1M tokens (input), $4.40 per 1M tokens (output) |
| Hosting | Per time deployed modell | $1.70/time (Standard/Global Standard) |
| Inference | Per token ved inferens | Samme som base-modell + hosting fee |
Viktig: Fine-tunede modeller påløper hosting-kostnad selv om de ikke brukes. Slett ubrukte deployments for å unngå unødvendige kostnader.
Confidence: Høy (basert på Azure OpenAI fine-tuning kostnadsdokumentasjon)
Arkitekturmønstre
Mønster 1: Model Router for dynamisk modellvalg
Konsept: Bruk Microsoft Foundry Model Router for å automatisk velge den mest kostnadseffektive modellen basert på prompt-kompleksitet.
Fordeler:
- Opptil 60% kostnadsreduksjon vs. alltid-bruk-GPT-5
- Automatisk ruting basert på kompleksitet
- Ingen kodeendringer nødvendig
Implementering:
- Deploy Model Router i Microsoft Foundry
- Konfigurer underliggende modeller (f.eks. GPT-4.1-nano, GPT-4.1-mini, GPT-4.1)
- Model Router analyserer prompt og velger passende modell
Use case: Chatbots, kundesupport, assistenter med varierende spørsmålskompleksitet
Confidence: Høy (Model Router er GA-funksjonalitet i Microsoft Foundry)
Mønster 2: Tiered model strategy (Small → Medium → Large)
Konsept: Kaskaderende modellvalg basert på oppgavetype:
| Tier | Modell | Bruksområde | Kostnad/1M tokens (verifisert juni 2026) |
|---|---|---|---|
| Tier 1 | GPT-4.1-nano | Enkel triage, klassifisering, korte svar | $0.10 input, $0.40 output |
| Tier 2 | GPT-4.1-mini | Moderat kompleksitet, standarddrafting | $0.40 input, $1.60 output |
| Tier 3 | GPT-4.1 / GPT-5-mini | Kompleks analyse, resonnering | GPT-4.1 $2.00/$8.00 · GPT-5-mini $0.25/$2.00 |
Implementering:
def select_model(task_complexity: str):
if task_complexity == "simple":
return "gpt-4.1-nano"
elif task_complexity == "moderate":
return "gpt-4.1-mini"
else:
return "gpt-5-mini"
ROI-eksempel:
- 1 million forespørsler/måned
- 70% simple (Tier 1), 25% moderate (Tier 2), 5% komplekse (Tier 3)
- Estimert besparelse: 50-70% vs. alltid bruke GPT-4.1
Confidence: Høy (best practice-mønster dokumentert i Azure-veiledning)
Mønster 3: Reasoning-nivå optimalisering (GPT-5)
Konsept: For GPT-5-modeller, juster reasoning-nivå basert på oppgavekompleksitet.
| Reasoning-nivå | Latens | Kostnad | Nøyaktighet | Bruksområde |
|---|---|---|---|---|
| Minimal | Raskest | Lavest | Lavest | Bulk-operasjoner, enkle transformasjoner |
| Low | Rask | Lav | Moderat | Triage, korte svar, enkle redigeringer |
| Medium (default) | Moderat | Middels | God | Innholdsdrafting, moderat koding, RAG Q&A |
| High | Sakte | Høyest | Høyest | Kompleks planlegging, analyse, multi-hop reasoning |
Implementering:
response = client.responses.create(
model="gpt-5",
reasoning_effort="low", # Juster basert på oppgave
input=[{"role": "user", "content": "Simple query"}]
)
Kostnadssparepotensial: 40-60% for oppgaver som ikke krever deep reasoning.
Confidence: Høy (reasoning-nivåer er dokumentert GPT-5-funksjonalitet)
Mønster 4: Batch processing for ikke-sanntidsoppgaver
Konsept: Bruk batch-prosessering med billigere modeller for oppgaver uten sanntidskrav.
Fordeler:
- Lavere kostnader (batch-rabatter hvis tilgjengelig)
- Kan bruke mindre modeller med lengre behandlingstid
- Bedre ressursutnyttelse
Use case:
- Nattlig rapportgenerering
- E-postsammendrag
- Innholdsmoderering (ikke-sanntid)
- Databearbeiding
Confidence: Moderat (batch processing er best practice, men ikke alltid prisrabattert)
Mønster 5: Prompt optimization for token-reduksjon
Konsept: Reduser token-bruk gjennom prompt-optimalisering:
| Teknikk | Token-besparelse | Implementering |
|---|---|---|
| Fjern verbose instruksjoner | 10-30% | Konsis prompts, fjern overflødige ord |
| Few-shot → Zero-shot | 20-50% | Fjern eksempler hvis modellen håndterer det |
| Kontekst-komprimering | 30-60% | Bruk embeddings/semantic search for relevant kontekst |
| Output length limiting | Varierer | Sett max_tokens eksplisitt |
ROI-eksempel:
- Original prompt: 500 tokens input, 200 tokens output
- Optimalisert prompt: 250 tokens input, 150 tokens output
- Token-reduksjon: 50% input, 25% output
- Kostnadssparing: ~40-45% per forespørsel
Confidence: Høy (token-optimalisering er best practice)
Beslutningsveiledning
Beslutningstre for modellvalg
START
↓
Krever oppgaven deep reasoning/multi-step logikk?
├─ JA → Velg GPT-5 (juster reasoning-nivå)
└─ NEI → Er latens kritisk (< 200ms)?
├─ JA → Velg GPT-4.1-nano eller GPT-4.1-mini
└─ NEI → Er oppgaven kompleks?
├─ JA → Velg GPT-4.1 eller GPT-4.1-mini
└─ NEI → Velg GPT-4.1-nano (billigste)
Scenario-basert modellanbefaling
| Scenario | Anbefalt modell | Begrunnelse |
|---|---|---|
| Kundesupport chatbot | GPT-4.1-mini + Model Router | Balanse mellom kostnad og kvalitet, dynamisk tilpasning |
| Kodegenerering | GPT-5-mini (medium reasoning) | Krever resonnering, men ikke maksimal |
| Dokumentanalyse (juridisk/finans) | GPT-5 (high reasoning) | Høy nøyaktighet viktigere enn kostnad |
| E-postklassifisering | GPT-4.1-nano | Enkel oppgave, høyt volum |
| RAG-basert Q&A | GPT-4.1-mini | Moderat kompleksitet, kontekst fra retrieval |
| Innholdsmoderering | GPT-4.1-nano + Content Safety | Høyt volum, enkel klassifisering |
| Enterprise Copilot | GPT-5 (medium reasoning) + GPT-4.1-mini fallback | Komplekse oppgaver krever resonnering, enkle bruker mini |
Confidence: Høy (basert på Microsoft best practices og modellkarakteristikker)
Kvantitativ ROI-kalkulator (konseptuell)
Input:
- Månedlig forespørselsvolum: N
- Gjennomsnittlig input tokens: I
- Gjennomsnittlig output tokens: O
- Nåværende modell: M_current
- Foreslått modell: M_new
Beregning:
Total tokens/måned = N × (I + O)
Kostnad_current = (I × pris_input_M_current + O × pris_output_M_current) × N / 1 000 000
Kostnad_new = (I × pris_input_M_new + O × pris_output_M_new) × N / 1 000 000
Månedlig besparelse (NOK) = (Kostnad_current - Kostnad_new) × USD_to_NOK
Eksempel:
- 1M forespørsler/måned, 200 input tokens, 100 output tokens
- Current: GPT-4.1 ($2.00 input, $8.00 output per 1M tokens)
- New: GPT-4.1-mini ($1.00 input, $4.00 output per 1M tokens)
- Kostnad_current = (200 × $2.00 + 100 × $8.00) × 1 / 1000 = $1 200
- Kostnad_new = (200 × $1.00 + 100 × $4.00) × 1 / 1000 = $600
- Besparelse: $600/måned (~6 600 NOK/måned ved USD 1 = NOK 11)
Confidence: Moderat (priseksempler er illustrative, faktiske priser varierer)
Integrasjon med Microsoft-stakken
Microsoft Foundry Model Catalog
Tilgang til modellkatalog:
- Gå til Microsoft Foundry
- Velg Model Catalog i venstre meny
- Filtrer på "Azure OpenAI" for Microsoft-modeller
- Sammenlign modeller basert på:
- Input/output token-priser
- Context window size
- Capabilities (vision, function calling, etc.)
- Regional tilgjengelighet
Confidence: Høy (Microsoft Foundry er GA)
Azure Cost Management + Budgets
Integrasjon for kostnadssporing:
| Funksjon | Beskrivelse | Verdi |
|---|---|---|
| Cost Analysis | Per-modell kostnadsinnsikt via deployment tags | Identifiser dyreste modeller |
| Budgets + Alerts | Varsler ved kostnadsterskler | Forhindre budsjettoverskridelser |
| Export til Storage | Daglig/ukentlig kostnadseksport | Dypere analyse i Power BI/Excel |
Implementering:
- Gå til Azure Portal → Cost Management
- Opprett budget scoped til resource group
- Sett alerts ved 50%, 75%, 90% av budsjett
- Grupper kostnader etter "Meter" for å se per-modell kostnad
Confidence: Høy (Cost Management er standard Azure-funksjonalitet)
Power Platform AI Builder
Modellvalg i AI Builder:
- AI Builder / prompt builder bruker GPT-4.1 mini som standardmodell for generative oppgaver (GPT-4o mini og GPT-4o brukes nå kun i US government-regioner)
- Ingen direkte modellvalg tilgjengelig i AI Builder-grensesnittet
- Kostnader inkludert i AI Builder credits (500 credits/bruker/måned i premium-planer)
Optimalisering:
- Begrens prompt-lengde
- Bruk structured outputs for å redusere token-bruk
Confidence: Moderat (basert på Power Platform dokumentasjon)
Copilot Studio
Modellstrategi i Copilot Studio:
- Copilot Studio bruker Azure OpenAI-modeller (GPT-4o eller GPT-4.1-serien)
- Licenskostnad dekker inferenskostnader (per Q2 2024)
- Vurder Generative Answers vs. custom topics for kostnadskontroll
Optimalisering:
- Bruk Boosted Conversations kun når nødvendig
- Optimaliser Generative Answers med tydelige fallback-scenarier
Confidence: Moderat (Copilot Studio-lisensiering kan endre seg)
Offentlig sektor (Norge)
Kostnadskontroll i offentlige anskaffelser
Krav til kostnadstransparens:
- Offentlige virksomheter må kunne dokumentere kostnader per tjeneste/bruker
- Azure Cost Management gir nødvendig sporbarhet
- Tagging-strategi anbefales:
project,department,cost-center
Anbefaling:
- Etabler månedlig kostnadsrapportering per prosjekt
- Bruk PTU (Provisioned Throughput) for forutsigbare budsjetter i produksjon
- Test med Standard deployment, migrer til PTU ved stabil bruk
Confidence: Høy (basert på generell offentlig sektor best practice)
Compliance og dataplassering
Kostnad vs. compliance:
- Standard deployment (regional): Høyere kostnad, garantert data residency i Norge
- Global Standard: Lavere kostnad, ingen data residency-garanti
Anbefaling for offentlig sektor:
- Velg Standard deployment i Norway East for personopplysninger (GDPR)
- Vurder Global Standard for ikke-sensitive workloads (potensielt 10-20% billigere)
Confidence: Høy (basert på Azure OpenAI deployment-dokumentasjon)
TCO for offentlig AI-satsning
Total Cost of Ownership-komponenter:
| Kostnadselement | Estimat (årlig, små prosjekter) | Optimalisering |
|---|---|---|
| Azure OpenAI inferens | 50 000 - 200 000 NOK | Modellvalg, prompt-optimalisering |
| Azure AI Search (RAG) | 30 000 - 100 000 NOK | Indeksoptimalisering, partitioning |
| Azure Storage | 5 000 - 20 000 NOK | Lifecycle policies |
| Azure Monitor/App Insights | 10 000 - 30 000 NOK | Sampling, log retention |
| Lisenser (Copilot Studio) | 200 - 2 000 NOK/bruker/måned | Pilot med få brukere først |
Total estimert TCO (små prosjekter): 100 000 - 500 000 NOK/år (ekskl. personellkostnader)
Confidence: Lav-Moderat (estimater er generelle, varierer betydelig per use case)
Kostnad og lisensiering
Lisensmodeller for Microsoft AI
| Produkt | Lisensmodell | AI-kostnad inkludert? | Ekstra kostnad |
|---|---|---|---|
| Azure OpenAI | Pay-per-token eller PTU | Nei | Basert på bruk eller PTU-reservasjon |
| Copilot Studio | Per bruker/måned (~$200/måned) | Ja (inferens inkludert) | Økt bruk kan koste ekstra |
| Power Platform (premium) | Per bruker/måned (~$40/bruker) | Delvis (500 AI Builder credits/bruker) | Ytterligere credits må kjøpes |
| M365 Copilot | Per bruker/måned (~$360/bruker) | Ja (inferens inkludert) | Ingen ekstra kostnad |
Viktig: Priser er illustrative per januar 2026. Verifiser på Microsoft lisensside.
Confidence: Moderat (lisenser endres regelmessig)
Cost avoidance-strategier
| Strategi | Potensial besparelse | Kompleksitet |
|---|---|---|
| Bytt fra GPT-4.1 til GPT-4.1-mini | 50% | Lav (krever testing) |
| Bruk Model Router | 30-60% | Middels (Microsoft Foundry-setup) |
| Prompt-optimalisering | 20-40% | Lav (kan gjøres iterativt) |
| Fine-tuning for å erstatte større modell | 40-70% | Høy (krever treningsdata og vedlikehold) |
| Migrering til PTU (ved høyt volum) | 20-50% | Middels (krever volumprediksjon) |
| Caching (for repeterende prompts) | 10-30% | Lav-Middels (krever cache-logikk) |
Confidence: Moderat (besparelsespotensial varierer per use case)
Regional prisvariasjoner
Eksempel (verifiser på Azure-prisside):
- Norway East: Standard pricing
- West Europe: Standard pricing
- East US: ~5-10% billigere (ikke-europeisk region)
Anbefaling for norske virksomheter:
- Bruk Norway East for compliance-sensitive data
- Vurder West Europe for ikke-sensitive workloads (latens vs. kostnad)
Confidence: Moderat (prisvariasjon finnes, men er ofte marginal)
For arkitekten (Cosmo)
Når bruke denne referansen
Triggers:
- Bruker spør: "Hvilken modell bør jeg bruke for [use case]?"
- Bruker ønsker kostnadsoptimalisering av eksisterende løsning
- Bruker planlegger høyvolum-deployment og er bekymret for kostnad
- Bruker vil sammenligne GPT-4o-mini vs. GPT-4.1 vs. GPT-5
Rådgivningsprosess
1. Forstå use case:
- Hva skal modellen gjøre? (klassifisering, generering, resonnering)
- Hva er volumet? (forespørsler/dag, tokens per forespørsel)
- Hva er latenskrav? (sanntid vs. batch)
2. Foreslå modellstrategi:
- Bruk beslutningstreet i "Beslutningsveiledning"
- Anbefal tiered approach hvis varierende kompleksitet
- Vurder Model Router for dynamisk ruting
3. Estimer kostnader:
- Bruk ROI-kalkulatoren (konseptuell seksjon)
- Sammenlign nåværende vs. foreslått modell
- Inkluder TCO (ikke bare inferenskostnad)
4. Anbefal testing:
- "Start med GPT-4.1-mini, evaluer kvalitet"
- "Opprett evaluation dataset for sammenligning"
- "Test i 1-2 uker før full rollout"
5. Oppfølging:
- Sett opp Cost Management alerts
- Følg opp med Azure Monitor for ytelsesmetrikker
- Juster modellvalg basert på faktisk bruk
Typiske spørsmål og svar
Q: "Skal jeg alltid bruke billigste modell?" A: Nei. Velg den minste modellen som oppfyller kvalitetskravene. Hvis GPT-4.1-nano gir 70% kvalitet men GPT-4.1-mini gir 95%, kan ekstra kostnad være verdt det.
Q: "Hvordan vet jeg om GPT-4.1-mini er god nok vs. GPT-4.1?" A: Opprett et evaluation dataset (50-100 representative eksempler), kjør begge modeller, sammenlign output. Bruk Microsoft Foundry evaluations for strukturert testing.
Q: "Er fine-tuning alltid billigere?" A: Nei. Fine-tuning har opfront-kostnad (training) og hosting-kostnad ($1.70/time). Kun kostnadseffektivt ved høyt volum (>100K forespørsler/måned) eller hvis du kan erstatte GPT-4.1 med fine-tuned GPT-4.1-mini.
Q: "Hvordan optimalisere kostnader for RAG-løsning?" A:
- Bruk semantic search for å redusere kontekst-tokens
- Velg GPT-4.1-mini for spørsmål med god retrieval
- Fallback til GPT-4.1 hvis ikke confident svar
- Optimaliser chunking-strategi i Azure AI Search
Confidence markers i rådgivning
Bruk alltid confidence markers når du anbefaler modeller:
- Høy confidence: "GPT-4.1-mini er dokumentert 50% billigere enn GPT-4.1 for samme deployment-type."
- Moderat confidence: "Basert på lignende use cases, forventer jeg 30-50% kostnadsreduksjon."
- Lav confidence: "Uten å teste på ditt spesifikke dataset, er det vanskelig å si om GPT-4.1-nano vil være tilstrekkelig."
Verktøy for kostnadsestimering
Anbefal alltid:
- Azure Pricing Calculator for estimering
- Microsoft Foundry Calculator for PTU-estimering
- Azure Cost Management for faktisk kostnadssporing
Vanlige fallgruver
| Fallgruve | Konsekvens | Hvordan unngå |
|---|---|---|
| Alltid bruke GPT-5 | 3-5x høyere kostnad | Vurder GPT-4.1-mini eller GPT-4.1 først |
| Glemme hosting-kostnad for fine-tuning | $1.70/time × 24 × 30 = $1 224/måned | Slett ubrukte fine-tuned deployments |
| Ikke sette max_tokens | Unødvendig lange svar = høyere output-kostnad | Sett max_tokens eksplisitt |
| Bruke Standard over Global Standard uten grunn | 10-20% høyere kostnad | Velg Global Standard hvis data residency ikke kreves |
| Ikke monitere kostnader | Uventede regninger | Sett opp Cost Management alerts |
Kilder og verifisering
Primærkilder (Microsoft Learn)
-
GPT-5 vs GPT-4.1: choosing the right model for your use case URL: https://learn.microsoft.com/en-us/azure/foundry/foundry-models/how-to/model-choice-guide?view=foundry-classic Hentet: 2026-02 Innhold: Modellsammenligninger, latency trade-offs, reasoning-nivåer
-
Plan to manage costs for Azure OpenAI in Foundry Models URL: https://learn.microsoft.com/en-us/azure/foundry/concepts/manage-costs Hentet: 2026-02 Innhold: Billing models, token pricing, cost monitoring
-
Cost management for fine-tuning URL: https://learn.microsoft.com/en-us/azure/foundry/openai/how-to/fine-tuning-cost-management?view=foundry-classic Hentet: 2026-02 Innhold: Training costs, hosting costs, deployment types
-
Optimize model cost and performance URL: https://learn.microsoft.com/en-us/azure/foundry/control-plane/how-to-optimize-cost-performance?view=foundry Hentet: 2026-02 Innhold: Model Router, cost optimization workflows
-
Azure OpenAI in Foundry Models URL: https://learn.microsoft.com/en-us/azure/foundry/foundry-models/concepts/models-sold-directly-by-azure Hentet: 2026-02 Innhold: Model catalog, capabilities, regional availability
-
Understanding costs associated with provisioned throughput units (PTU) URL: https://learn.microsoft.com/en-us/azure/foundry/openai/concepts/provisioned-throughput-billing Hentet: 2026-02 Innhold: PTU pricing, throughput per PTU, when to use PTU
Sekundærkilder
-
Azure OpenAI Pricing Page URL: https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/ Note: Offisiell prisside (sjekk for oppdaterte priser)
-
Azure Pricing Calculator URL: https://azure.microsoft.com/pricing/calculator/ Note: For pre-deployment estimering
-
Microsoft Foundry Calculator URL: https://ai.azure.com/resource/calculator Note: For PTU-estimering
Verifiseringsstatus
| Påstand | Kilde | Confidence |
|---|---|---|
| GPT-4.1-mini er 50% billigere enn GPT-4.1 | Source 2, illustrative pricing examples | Høy |
| Model Router kan spare opptil 60% | Source 4 | Høy |
| Fine-tuning hosting cost er $1.70/time | Source 3 | Høy |
| GPT-5 har fire reasoning-nivåer | Source 1 | Høy |
| PTU gir 3 000 input TPM per PTU for GPT-4.1 | Source 6 | Høy |
Totalt antall kilder: 9 (6 primære Microsoft Learn-artikler, 3 pricing-referanser) MCP-kall brukt: 6 (4x docs_search, 2x docs_fetch)
Siste oppdatering og gyldighet
Dokumentasjonsdato: Januar-februar 2026; modell-enumerasjon oppdatert 2026-06
Priser gyldige per: Februar 2026 (illustrative — verifiser alltid på offisiell prisside)
Modeller i GA (per 2026-06): GPT-4.1-serien, GPT-4o/GPT-4o-mini, o-serien (o1/o3/o3-mini/o4-mini), og GPT-5-generasjonen: GPT-5/-mini/-nano (2025-08), GPT-5.1 (2025-11-13), GPT-5.2 (2025-12-11), GPT-5.3-codex/-chat (2026-02/03), GPT-5.4 + GPT-5.4-pro (2026-03-05), GPT-5.5 (2026-04-24), gpt-chat-latest (2026-05, preview). Snapshotten over (GPT-5 / GPT-4.1 / GPT-4o-mini) er én generasjon bak — GPT-5.1→5.5 finnes nå. Full, region-verifisert modellkatalog: model-catalog-2026.md.
Neste review anbefalt: Q4 2026 (Microsoft oppdaterer priser kvartalsvis)
Dokumenteier: Cosmo Skyberg, Microsoft AI Solution Architect Godkjent for: Offentlig sektor Norge, Enterprise Azure-kunder Versjon: 1.0