# Model Selection for Cost-Efficiency **Last updated:** 2026-06 **Status:** GA **Category:** Cost Optimization & FinOps for AI **Source:** https://learn.microsoft.com/azure/foundry/foundry-models/concepts/models-sold-directly-by-azure **Type:** reference --- ## Innhold - [Introduksjon](#introduksjon) - [Kjernekomponenter](#kjernekomponenter) - [Arkitekturmønstre](#arkitekturmønstre) - [Beslutningsveiledning](#beslutningsveiledning) - [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken) - [Offentlig sektor (Norge)](#offentlig-sektor-norge) - [Kostnad og lisensiering](#kostnad-og-lisensiering) - [For arkitekten (Cosmo)](#for-arkitekten-cosmo) - [Kilder og verifisering](#kilder-og-verifisering) ## Introduksjon Valg av AI-modell har direkte innvirkning på både ytelse og kostnad. Microsoft Azure AI tilbyr et bredt spekter av modeller med ulike pris-/ytelsekarakteristikker — fra små, kostnadseffektive modeller som GPT-4o mini og GPT-4.1-nano, til store resonneringsmodeller som GPT-5. Riktig modellvalg kan redusere kostnader med 60-80% uten å ofre kvalitet for det aktuelle bruksområdet. > **Merk (2026-06):** Denne referansens modelleksempler (GPT-5 / GPT-4.1 / GPT-4o-mini) er én generasjon bak. GPT-5-generasjonen er nå utvidet til GPT-5.1→5.5 (jf. `models-sold-directly-by-azure`). Pris-/ytelsesprinsippene under er fortsatt gyldige, men ved konkret modellvalg: bruk den region-verifiserte `model-catalog-2026.md`. **Confidence:** Høy (basert på offisiell Microsoft-dokumentasjon, jan 2026) Denne referansen gir strukturert veiledning for å velge mest kostnadseffektive modell basert på: - Arbeidsbelastningens kompleksitet (reasoning vs. hurtige svar) - Latenskrav (sanntid vs. batch) - Volum (tokens per minutt, forespørsler per minutt) - Budsjettrammer **Nøkkelprinsipp:** Velg den minste modellen som oppfyller kvalitetskravene dine. Større modeller = høyere kostnader per token. --- ## Kjernekomponenter ### 1. Modellklasser og prisposisjonering Microsoft Azure AI-plattformen tilbyr flere modellklasser med distinkte pris-/ytelsekarakteristikker: | Modellklasse | Eksempler | Bruksområde | Relativ kostnad | Latens | |--------------|-----------|-------------|-----------------|--------| | **Resonneringsmodeller** | GPT-5, GPT-5-mini, GPT-5-nano | Kompleks analyse, multi-steg logikk, planlegging | Høyest | Høyere | | **Store generelle modeller** | GPT-4.1, GPT-4o | Balansert ytelse, generelle oppgaver | Middels-høy | Moderat | | **Små effektive modeller** | GPT-4.1-mini, GPT-4.1-nano, GPT-4o-mini | Høyt volum, sanntid, enklere oppgaver | Lavest | Lavest | | **Spesialiserte modeller** | Embeddings, Whisper, DALL-E | Embeddings, tale, bilder | Varierer | Varierer | **Confidence:** Høy (basert på Azure OpenAI-prisside og modellkatalog, feb 2026) ### 2. Token-basert prismodell Azure OpenAI-tjenester prises per 1 000 tokens (1K) eller 1 million tokens (1M), avhengig av modell: **GPT-4o mini (eksempel — verifiser på [Azure OpenAI pricing](https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/)):** - Input: ~$0.15 per 1M tokens - Output: ~$0.60 per 1M tokens **GPT-4.1 (eksempel):** - Input: ~$2.00 per 1M tokens - Output: ~$8.00 per 1M tokens **GPT-5 (verifisert juni 2026):** - Input: $1.25 per 1M tokens (cached $0.125) - Output: $10.00 per 1M tokens - Merk: resonnerings-tokens faktureres som output — `high` reasoning_effort kan øke effektiv kost vesentlig **Viktig:** Rå token-priser eies av det kanoniske registeret (`deterministic-cost-calculation-model.md` §1.1). Sjekk alltid [offisiell prisside](https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/) for eksakte satser per region og modellversjon. **Confidence:** Moderat (priseksempler fra dokumentasjon, men priser kan variere) ### 3. Deployment-typer og kostnadsimplikasjon | Deployment-type | Prismodell | Best for | Kostnadspredikabilitet | |-----------------|------------|----------|------------------------| | **Standard** | Pay-per-token | Variabelt volum, testing | Lav (avhenger av bruk) | | **Global Standard** | Pay-per-token (ingen data residency) | Høyt volum, global tilgang | Lav (avhenger av bruk) | | **Provisioned Throughput (PTU)** | Fast PTU-time-pris | Forutsigbart volum, latens-SLA | Høy (fast kostnad) | | **Developer Tier (fine-tuning)** | Pay-per-token, ingen hosting-fee | Evaluering, POC (auto-slettes etter 24t) | Lav (midlertidig) | **PTU-eksempel:** - 1 PTU = ~5 400 input tokens/minutt for o4-mini - 1 PTU = ~3 000 input tokens/minutt for GPT-4.1 - PTU-pris varierer per avtale/reservasjon **Confidence:** Høy (basert på Azure OpenAI deployment-dokumentasjon) ### 4. Fine-tuning kostnadsmønstre Fine-tunede modeller har tre kostnadsdimensjoner: | Kostnadselement | Beskrivelse | Eksempel (o4-mini) | |-----------------|-------------|-------------------| | **Training** | Per token i treningsfil | ~$1.10 per 1M tokens (input), $4.40 per 1M tokens (output) | | **Hosting** | Per time deployed modell | $1.70/time (Standard/Global Standard) | | **Inference** | Per token ved inferens | Samme som base-modell + hosting fee | **Viktig:** Fine-tunede modeller påløper hosting-kostnad selv om de ikke brukes. Slett ubrukte deployments for å unngå unødvendige kostnader. **Confidence:** Høy (basert på Azure OpenAI fine-tuning kostnadsdokumentasjon) --- ## Arkitekturmønstre ### Mønster 1: Model Router for dynamisk modellvalg **Konsept:** Bruk Microsoft Foundry Model Router for å automatisk velge den mest kostnadseffektive modellen basert på prompt-kompleksitet. **Fordeler:** - Opptil 60% kostnadsreduksjon vs. alltid-bruk-GPT-5 - Automatisk ruting basert på kompleksitet - Ingen kodeendringer nødvendig **Implementering:** 1. Deploy Model Router i Microsoft Foundry 2. Konfigurer underliggende modeller (f.eks. GPT-4.1-nano, GPT-4.1-mini, GPT-4.1) 3. Model Router analyserer prompt og velger passende modell **Use case:** Chatbots, kundesupport, assistenter med varierende spørsmålskompleksitet **Confidence:** Høy (Model Router er GA-funksjonalitet i Microsoft Foundry) ### Mønster 2: Tiered model strategy (Small → Medium → Large) **Konsept:** Kaskaderende modellvalg basert på oppgavetype: | Tier | Modell | Bruksområde | Kostnad/1M tokens (verifisert juni 2026) | |------|--------|-------------|------------------------------------------| | **Tier 1** | GPT-4.1-nano | Enkel triage, klassifisering, korte svar | $0.10 input, $0.40 output | | **Tier 2** | GPT-4.1-mini | Moderat kompleksitet, standarddrafting | $0.40 input, $1.60 output | | **Tier 3** | GPT-4.1 / GPT-5-mini | Kompleks analyse, resonnering | GPT-4.1 $2.00/$8.00 · GPT-5-mini $0.25/$2.00 | **Implementering:** ```python def select_model(task_complexity: str): if task_complexity == "simple": return "gpt-4.1-nano" elif task_complexity == "moderate": return "gpt-4.1-mini" else: return "gpt-5-mini" ``` **ROI-eksempel:** - 1 million forespørsler/måned - 70% simple (Tier 1), 25% moderate (Tier 2), 5% komplekse (Tier 3) - Estimert besparelse: 50-70% vs. alltid bruke GPT-4.1 **Confidence:** Høy (best practice-mønster dokumentert i Azure-veiledning) ### Mønster 3: Reasoning-nivå optimalisering (GPT-5) **Konsept:** For GPT-5-modeller, juster reasoning-nivå basert på oppgavekompleksitet. | Reasoning-nivå | Latens | Kostnad | Nøyaktighet | Bruksområde | |----------------|--------|---------|-------------|-------------| | **Minimal** | Raskest | Lavest | Lavest | Bulk-operasjoner, enkle transformasjoner | | **Low** | Rask | Lav | Moderat | Triage, korte svar, enkle redigeringer | | **Medium (default)** | Moderat | Middels | God | Innholdsdrafting, moderat koding, RAG Q&A | | **High** | Sakte | Høyest | Høyest | Kompleks planlegging, analyse, multi-hop reasoning | **Implementering:** ```python response = client.responses.create( model="gpt-5", reasoning_effort="low", # Juster basert på oppgave input=[{"role": "user", "content": "Simple query"}] ) ``` **Kostnadssparepotensial:** 40-60% for oppgaver som ikke krever deep reasoning. **Confidence:** Høy (reasoning-nivåer er dokumentert GPT-5-funksjonalitet) ### Mønster 4: Batch processing for ikke-sanntidsoppgaver **Konsept:** Bruk batch-prosessering med billigere modeller for oppgaver uten sanntidskrav. **Fordeler:** - Lavere kostnader (batch-rabatter hvis tilgjengelig) - Kan bruke mindre modeller med lengre behandlingstid - Bedre ressursutnyttelse **Use case:** - Nattlig rapportgenerering - E-postsammendrag - Innholdsmoderering (ikke-sanntid) - Databearbeiding **Confidence:** Moderat (batch processing er best practice, men ikke alltid prisrabattert) ### Mønster 5: Prompt optimization for token-reduksjon **Konsept:** Reduser token-bruk gjennom prompt-optimalisering: | Teknikk | Token-besparelse | Implementering | |---------|------------------|----------------| | **Fjern verbose instruksjoner** | 10-30% | Konsis prompts, fjern overflødige ord | | **Few-shot → Zero-shot** | 20-50% | Fjern eksempler hvis modellen håndterer det | | **Kontekst-komprimering** | 30-60% | Bruk embeddings/semantic search for relevant kontekst | | **Output length limiting** | Varierer | Sett `max_tokens` eksplisitt | **ROI-eksempel:** - Original prompt: 500 tokens input, 200 tokens output - Optimalisert prompt: 250 tokens input, 150 tokens output - Token-reduksjon: 50% input, 25% output - Kostnadssparing: ~40-45% per forespørsel **Confidence:** Høy (token-optimalisering er best practice) --- ## Beslutningsveiledning ### Beslutningstre for modellvalg ``` START ↓ Krever oppgaven deep reasoning/multi-step logikk? ├─ JA → Velg GPT-5 (juster reasoning-nivå) └─ NEI → Er latens kritisk (< 200ms)? ├─ JA → Velg GPT-4.1-nano eller GPT-4.1-mini └─ NEI → Er oppgaven kompleks? ├─ JA → Velg GPT-4.1 eller GPT-4.1-mini └─ NEI → Velg GPT-4.1-nano (billigste) ``` ### Scenario-basert modellanbefaling | Scenario | Anbefalt modell | Begrunnelse | |----------|-----------------|-------------| | **Kundesupport chatbot** | GPT-4.1-mini + Model Router | Balanse mellom kostnad og kvalitet, dynamisk tilpasning | | **Kodegenerering** | GPT-5-mini (medium reasoning) | Krever resonnering, men ikke maksimal | | **Dokumentanalyse (juridisk/finans)** | GPT-5 (high reasoning) | Høy nøyaktighet viktigere enn kostnad | | **E-postklassifisering** | GPT-4.1-nano | Enkel oppgave, høyt volum | | **RAG-basert Q&A** | GPT-4.1-mini | Moderat kompleksitet, kontekst fra retrieval | | **Innholdsmoderering** | GPT-4.1-nano + Content Safety | Høyt volum, enkel klassifisering | | **Enterprise Copilot** | GPT-5 (medium reasoning) + GPT-4.1-mini fallback | Komplekse oppgaver krever resonnering, enkle bruker mini | **Confidence:** Høy (basert på Microsoft best practices og modellkarakteristikker) ### Kvantitativ ROI-kalkulator (konseptuell) **Input:** - Månedlig forespørselsvolum: N - Gjennomsnittlig input tokens: I - Gjennomsnittlig output tokens: O - Nåværende modell: M_current - Foreslått modell: M_new **Beregning:** ``` Total tokens/måned = N × (I + O) Kostnad_current = (I × pris_input_M_current + O × pris_output_M_current) × N / 1 000 000 Kostnad_new = (I × pris_input_M_new + O × pris_output_M_new) × N / 1 000 000 Månedlig besparelse (NOK) = (Kostnad_current - Kostnad_new) × USD_to_NOK ``` **Eksempel:** - 1M forespørsler/måned, 200 input tokens, 100 output tokens - Current: GPT-4.1 ($2.00 input, $8.00 output per 1M tokens) - New: GPT-4.1-mini ($1.00 input, $4.00 output per 1M tokens) - Kostnad_current = (200 × $2.00 + 100 × $8.00) × 1 / 1000 = $1 200 - Kostnad_new = (200 × $1.00 + 100 × $4.00) × 1 / 1000 = $600 - Besparelse: $600/måned (~6 600 NOK/måned ved USD 1 = NOK 11) **Confidence:** Moderat (priseksempler er illustrative, faktiske priser varierer) --- ## Integrasjon med Microsoft-stakken ### Microsoft Foundry Model Catalog **Tilgang til modellkatalog:** 1. Gå til [Microsoft Foundry](https://ai.azure.com) 2. Velg **Model Catalog** i venstre meny 3. Filtrer på "Azure OpenAI" for Microsoft-modeller 4. Sammenlign modeller basert på: - Input/output token-priser - Context window size - Capabilities (vision, function calling, etc.) - Regional tilgjengelighet **Confidence:** Høy (Microsoft Foundry er GA) ### Azure Cost Management + Budgets **Integrasjon for kostnadssporing:** | Funksjon | Beskrivelse | Verdi | |----------|-------------|-------| | **Cost Analysis** | Per-modell kostnadsinnsikt via deployment tags | Identifiser dyreste modeller | | **Budgets + Alerts** | Varsler ved kostnadsterskler | Forhindre budsjettoverskridelser | | **Export til Storage** | Daglig/ukentlig kostnadseksport | Dypere analyse i Power BI/Excel | **Implementering:** 1. Gå til Azure Portal → Cost Management 2. Opprett budget scoped til resource group 3. Sett alerts ved 50%, 75%, 90% av budsjett 4. Grupper kostnader etter "Meter" for å se per-modell kostnad **Confidence:** Høy (Cost Management er standard Azure-funksjonalitet) ### Power Platform AI Builder **Modellvalg i AI Builder:** - AI Builder / prompt builder bruker **GPT-4.1 mini** som standardmodell for generative oppgaver (GPT-4o mini og GPT-4o brukes nå kun i US government-regioner) - Ingen direkte modellvalg tilgjengelig i AI Builder-grensesnittet - Kostnader inkludert i AI Builder credits (500 credits/bruker/måned i premium-planer) **Optimalisering:** - Begrens prompt-lengde - Bruk structured outputs for å redusere token-bruk **Confidence:** Moderat (basert på Power Platform dokumentasjon) ### Copilot Studio **Modellstrategi i Copilot Studio:** - Copilot Studio bruker Azure OpenAI-modeller (GPT-4o eller GPT-4.1-serien) - Licenskostnad dekker inferenskostnader (per Q2 2024) - Vurder Generative Answers vs. custom topics for kostnadskontroll **Optimalisering:** - Bruk Boosted Conversations kun når nødvendig - Optimaliser Generative Answers med tydelige fallback-scenarier **Confidence:** Moderat (Copilot Studio-lisensiering kan endre seg) --- ## Offentlig sektor (Norge) ### Kostnadskontroll i offentlige anskaffelser **Krav til kostnadstransparens:** - Offentlige virksomheter må kunne dokumentere kostnader per tjeneste/bruker - Azure Cost Management gir nødvendig sporbarhet - Tagging-strategi anbefales: `project`, `department`, `cost-center` **Anbefaling:** - Etabler månedlig kostnadsrapportering per prosjekt - Bruk PTU (Provisioned Throughput) for forutsigbare budsjetter i produksjon - Test med Standard deployment, migrer til PTU ved stabil bruk **Confidence:** Høy (basert på generell offentlig sektor best practice) ### Compliance og dataplassering **Kostnad vs. compliance:** - **Standard deployment** (regional): Høyere kostnad, garantert data residency i Norge - **Global Standard**: Lavere kostnad, ingen data residency-garanti **Anbefaling for offentlig sektor:** - Velg **Standard deployment i Norway East** for personopplysninger (GDPR) - Vurder Global Standard for ikke-sensitive workloads (potensielt 10-20% billigere) **Confidence:** Høy (basert på Azure OpenAI deployment-dokumentasjon) ### TCO for offentlig AI-satsning **Total Cost of Ownership-komponenter:** | Kostnadselement | Estimat (årlig, små prosjekter) | Optimalisering | |-----------------|----------------------------------|----------------| | **Azure OpenAI inferens** | 50 000 - 200 000 NOK | Modellvalg, prompt-optimalisering | | **Azure AI Search (RAG)** | 30 000 - 100 000 NOK | Indeksoptimalisering, partitioning | | **Azure Storage** | 5 000 - 20 000 NOK | Lifecycle policies | | **Azure Monitor/App Insights** | 10 000 - 30 000 NOK | Sampling, log retention | | **Lisenser (Copilot Studio)** | 200 - 2 000 NOK/bruker/måned | Pilot med få brukere først | **Total estimert TCO (små prosjekter):** 100 000 - 500 000 NOK/år (ekskl. personellkostnader) **Confidence:** Lav-Moderat (estimater er generelle, varierer betydelig per use case) --- ## Kostnad og lisensiering ### Lisensmodeller for Microsoft AI | Produkt | Lisensmodell | AI-kostnad inkludert? | Ekstra kostnad | |---------|--------------|------------------------|----------------| | **Azure OpenAI** | Pay-per-token eller PTU | Nei | Basert på bruk eller PTU-reservasjon | | **Copilot Studio** | Per bruker/måned (~$200/måned) | Ja (inferens inkludert) | Økt bruk kan koste ekstra | | **Power Platform (premium)** | Per bruker/måned (~$40/bruker) | Delvis (500 AI Builder credits/bruker) | Ytterligere credits må kjøpes | | **M365 Copilot** | Per bruker/måned (~$360/bruker) | Ja (inferens inkludert) | Ingen ekstra kostnad | **Viktig:** Priser er illustrative per januar 2026. Verifiser på [Microsoft lisensside](https://www.microsoft.com/licensing/). **Confidence:** Moderat (lisenser endres regelmessig) ### Cost avoidance-strategier | Strategi | Potensial besparelse | Kompleksitet | |----------|----------------------|--------------| | **Bytt fra GPT-4.1 til GPT-4.1-mini** | 50% | Lav (krever testing) | | **Bruk Model Router** | 30-60% | Middels (Microsoft Foundry-setup) | | **Prompt-optimalisering** | 20-40% | Lav (kan gjøres iterativt) | | **Fine-tuning for å erstatte større modell** | 40-70% | Høy (krever treningsdata og vedlikehold) | | **Migrering til PTU (ved høyt volum)** | 20-50% | Middels (krever volumprediksjon) | | **Caching (for repeterende prompts)** | 10-30% | Lav-Middels (krever cache-logikk) | **Confidence:** Moderat (besparelsespotensial varierer per use case) ### Regional prisvariasjoner **Eksempel (verifiser på Azure-prisside):** - Norway East: Standard pricing - West Europe: Standard pricing - East US: ~5-10% billigere (ikke-europeisk region) **Anbefaling for norske virksomheter:** - Bruk Norway East for compliance-sensitive data - Vurder West Europe for ikke-sensitive workloads (latens vs. kostnad) **Confidence:** Moderat (prisvariasjon finnes, men er ofte marginal) --- ## For arkitekten (Cosmo) ### Når bruke denne referansen **Triggers:** - Bruker spør: "Hvilken modell bør jeg bruke for [use case]?" - Bruker ønsker kostnadsoptimalisering av eksisterende løsning - Bruker planlegger høyvolum-deployment og er bekymret for kostnad - Bruker vil sammenligne GPT-4o-mini vs. GPT-4.1 vs. GPT-5 ### Rådgivningsprosess **1. Forstå use case:** - Hva skal modellen gjøre? (klassifisering, generering, resonnering) - Hva er volumet? (forespørsler/dag, tokens per forespørsel) - Hva er latenskrav? (sanntid vs. batch) **2. Foreslå modellstrategi:** - Bruk beslutningstreet i "Beslutningsveiledning" - Anbefal tiered approach hvis varierende kompleksitet - Vurder Model Router for dynamisk ruting **3. Estimer kostnader:** - Bruk ROI-kalkulatoren (konseptuell seksjon) - Sammenlign nåværende vs. foreslått modell - Inkluder TCO (ikke bare inferenskostnad) **4. Anbefal testing:** - "Start med GPT-4.1-mini, evaluer kvalitet" - "Opprett evaluation dataset for sammenligning" - "Test i 1-2 uker før full rollout" **5. Oppfølging:** - Sett opp Cost Management alerts - Følg opp med Azure Monitor for ytelsesmetrikker - Juster modellvalg basert på faktisk bruk ### Typiske spørsmål og svar **Q: "Skal jeg alltid bruke billigste modell?"** **A:** Nei. Velg den minste modellen som oppfyller kvalitetskravene. Hvis GPT-4.1-nano gir 70% kvalitet men GPT-4.1-mini gir 95%, kan ekstra kostnad være verdt det. **Q: "Hvordan vet jeg om GPT-4.1-mini er god nok vs. GPT-4.1?"** **A:** Opprett et evaluation dataset (50-100 representative eksempler), kjør begge modeller, sammenlign output. Bruk Microsoft Foundry evaluations for strukturert testing. **Q: "Er fine-tuning alltid billigere?"** **A:** Nei. Fine-tuning har opfront-kostnad (training) og hosting-kostnad ($1.70/time). Kun kostnadseffektivt ved høyt volum (>100K forespørsler/måned) eller hvis du kan erstatte GPT-4.1 med fine-tuned GPT-4.1-mini. **Q: "Hvordan optimalisere kostnader for RAG-løsning?"** **A:** 1. Bruk semantic search for å redusere kontekst-tokens 2. Velg GPT-4.1-mini for spørsmål med god retrieval 3. Fallback til GPT-4.1 hvis ikke confident svar 4. Optimaliser chunking-strategi i Azure AI Search ### Confidence markers i rådgivning Bruk alltid confidence markers når du anbefaler modeller: - **Høy confidence:** "GPT-4.1-mini er dokumentert 50% billigere enn GPT-4.1 for samme deployment-type." - **Moderat confidence:** "Basert på lignende use cases, forventer jeg 30-50% kostnadsreduksjon." - **Lav confidence:** "Uten å teste på ditt spesifikke dataset, er det vanskelig å si om GPT-4.1-nano vil være tilstrekkelig." ### Verktøy for kostnadsestimering **Anbefal alltid:** 1. [Azure Pricing Calculator](https://azure.microsoft.com/pricing/calculator/) for estimering 2. [Microsoft Foundry Calculator](https://ai.azure.com/resource/calculator) for PTU-estimering 3. Azure Cost Management for faktisk kostnadssporing ### Vanlige fallgruver | Fallgruve | Konsekvens | Hvordan unngå | |-----------|------------|---------------| | **Alltid bruke GPT-5** | 3-5x høyere kostnad | Vurder GPT-4.1-mini eller GPT-4.1 først | | **Glemme hosting-kostnad for fine-tuning** | $1.70/time × 24 × 30 = $1 224/måned | Slett ubrukte fine-tuned deployments | | **Ikke sette max_tokens** | Unødvendig lange svar = høyere output-kostnad | Sett `max_tokens` eksplisitt | | **Bruke Standard over Global Standard uten grunn** | 10-20% høyere kostnad | Velg Global Standard hvis data residency ikke kreves | | **Ikke monitere kostnader** | Uventede regninger | Sett opp Cost Management alerts | --- ## Kilder og verifisering ### Primærkilder (Microsoft Learn) 1. **GPT-5 vs GPT-4.1: choosing the right model for your use case** URL: https://learn.microsoft.com/en-us/azure/foundry/foundry-models/how-to/model-choice-guide?view=foundry-classic Hentet: 2026-02 Innhold: Modellsammenligninger, latency trade-offs, reasoning-nivåer 2. **Plan to manage costs for Azure OpenAI in Foundry Models** URL: https://learn.microsoft.com/en-us/azure/foundry/concepts/manage-costs Hentet: 2026-02 Innhold: Billing models, token pricing, cost monitoring 3. **Cost management for fine-tuning** URL: https://learn.microsoft.com/en-us/azure/foundry/openai/how-to/fine-tuning-cost-management?view=foundry-classic Hentet: 2026-02 Innhold: Training costs, hosting costs, deployment types 4. **Optimize model cost and performance** URL: https://learn.microsoft.com/en-us/azure/foundry/control-plane/how-to-optimize-cost-performance?view=foundry Hentet: 2026-02 Innhold: Model Router, cost optimization workflows 5. **Azure OpenAI in Foundry Models** URL: https://learn.microsoft.com/en-us/azure/foundry/foundry-models/concepts/models-sold-directly-by-azure Hentet: 2026-02 Innhold: Model catalog, capabilities, regional availability 6. **Understanding costs associated with provisioned throughput units (PTU)** URL: https://learn.microsoft.com/en-us/azure/foundry/openai/concepts/provisioned-throughput-billing Hentet: 2026-02 Innhold: PTU pricing, throughput per PTU, when to use PTU ### Sekundærkilder 7. **Azure OpenAI Pricing Page** URL: https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/ Note: Offisiell prisside (sjekk for oppdaterte priser) 8. **Azure Pricing Calculator** URL: https://azure.microsoft.com/pricing/calculator/ Note: For pre-deployment estimering 9. **Microsoft Foundry Calculator** URL: https://ai.azure.com/resource/calculator Note: For PTU-estimering ### Verifiseringsstatus | Påstand | Kilde | Confidence | |---------|-------|------------| | GPT-4.1-mini er 50% billigere enn GPT-4.1 | Source 2, illustrative pricing examples | Høy | | Model Router kan spare opptil 60% | Source 4 | Høy | | Fine-tuning hosting cost er $1.70/time | Source 3 | Høy | | GPT-5 har fire reasoning-nivåer | Source 1 | Høy | | PTU gir 3 000 input TPM per PTU for GPT-4.1 | Source 6 | Høy | **Totalt antall kilder:** 9 (6 primære Microsoft Learn-artikler, 3 pricing-referanser) **MCP-kall brukt:** 6 (4x docs_search, 2x docs_fetch) ### Siste oppdatering og gyldighet **Dokumentasjonsdato:** Januar-februar 2026; modell-enumerasjon oppdatert 2026-06 **Priser gyldige per:** Februar 2026 (illustrative — verifiser alltid på offisiell prisside) **Modeller i GA (per 2026-06):** GPT-4.1-serien, GPT-4o/GPT-4o-mini, o-serien (o1/o3/o3-mini/o4-mini), og GPT-5-generasjonen: GPT-5/-mini/-nano (2025-08), GPT-5.1 (2025-11-13), GPT-5.2 (2025-12-11), GPT-5.3-codex/-chat (2026-02/03), GPT-5.4 + GPT-5.4-pro (2026-03-05), GPT-5.5 (2026-04-24), gpt-chat-latest (2026-05, preview). Snapshotten over (GPT-5 / GPT-4.1 / GPT-4o-mini) er én generasjon bak — GPT-5.1→5.5 finnes nå. Full, region-verifisert modellkatalog: `model-catalog-2026.md`. **Neste review anbefalt:** Q4 2026 (Microsoft oppdaterer priser kvartalsvis) --- **Dokumenteier:** Cosmo Skyberg, Microsoft AI Solution Architect **Godkjent for:** Offentlig sektor Norge, Enterprise Azure-kunder **Versjon:** 1.0