ms-ai-architect/skills/ms-ai-security/references/cost-optimization/model-selection-price-performance.md
Kjell Tore Guttormsen ddce43d8b2 feat(ms-ai-architect): Spor 1 — Port-1-substrat migrert på 4 ikke-advisor-skills (243 Source + 327 Type + 325 TOC + stale-verified poison fjernet) [skip-docs]
Steg 9 (R4): unified migrate-corpus.mjs --write over engineering/governance/
infrastructure/security. 327 filer mutert, verified=null, prosa byte-identisk
(fra første ## seksjon), advisor urørt (0 endringer).

To applier-fixes oppdaget under kjøring (TDD, RED→GREEN):
- insertHeaderFields: anker faller nå tilbake når en meta-linje selv passerer
  500B (2 filer pakket et avsnitt i **Status:** → Type/Source landet utenfor
  scan-vinduet, applierens post-write-assertion fanget + restaurerte).
- normalizeStaleVerified: fjerner nå ALLE stale non-date **Verified:** i
  500B-vinduet, inkl. stray body-dup rett under --- (9 mlops-genaiops-filer var
  ellers falskt "verified"/fresh, droppet fra worklist). Operatør-godkjent
  utvidelse av carve-out; kun stray metadata-linjer, aldri prosa.

test-transform-criterion: precondition oppdatert til post-migrasjons-sannhet
(fila bærer nå Source). Suite 728/728 grønn.
2026-07-04 10:19:11 +02:00

583 lines
25 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# Model Selection for Cost-Efficiency
**Last updated:** 2026-06
**Status:** GA
**Category:** Cost Optimization & FinOps for AI
**Source:** https://learn.microsoft.com/azure/foundry/foundry-models/concepts/models-sold-directly-by-azure
**Type:** reference
---
## Innhold
- [Introduksjon](#introduksjon)
- [Kjernekomponenter](#kjernekomponenter)
- [Arkitekturmønstre](#arkitekturmønstre)
- [Beslutningsveiledning](#beslutningsveiledning)
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
- [Kilder og verifisering](#kilder-og-verifisering)
## Introduksjon
Valg av AI-modell har direkte innvirkning på både ytelse og kostnad. Microsoft Azure AI tilbyr et bredt spekter av modeller med ulike pris-/ytelsekarakteristikker — fra små, kostnadseffektive modeller som GPT-4o mini og GPT-4.1-nano, til store resonneringsmodeller som GPT-5. Riktig modellvalg kan redusere kostnader med 60-80% uten å ofre kvalitet for det aktuelle bruksområdet.
> **Merk (2026-06):** Denne referansens modelleksempler (GPT-5 / GPT-4.1 / GPT-4o-mini) er én generasjon bak. GPT-5-generasjonen er nå utvidet til GPT-5.1→5.5 (jf. `models-sold-directly-by-azure`). Pris-/ytelsesprinsippene under er fortsatt gyldige, men ved konkret modellvalg: bruk den region-verifiserte `model-catalog-2026.md`.
**Confidence:** Høy (basert på offisiell Microsoft-dokumentasjon, jan 2026)
Denne referansen gir strukturert veiledning for å velge mest kostnadseffektive modell basert på:
- Arbeidsbelastningens kompleksitet (reasoning vs. hurtige svar)
- Latenskrav (sanntid vs. batch)
- Volum (tokens per minutt, forespørsler per minutt)
- Budsjettrammer
**Nøkkelprinsipp:** Velg den minste modellen som oppfyller kvalitetskravene dine. Større modeller = høyere kostnader per token.
---
## Kjernekomponenter
### 1. Modellklasser og prisposisjonering
Microsoft Azure AI-plattformen tilbyr flere modellklasser med distinkte pris-/ytelsekarakteristikker:
| Modellklasse | Eksempler | Bruksområde | Relativ kostnad | Latens |
|--------------|-----------|-------------|-----------------|--------|
| **Resonneringsmodeller** | GPT-5, GPT-5-mini, GPT-5-nano | Kompleks analyse, multi-steg logikk, planlegging | Høyest | Høyere |
| **Store generelle modeller** | GPT-4.1, GPT-4o | Balansert ytelse, generelle oppgaver | Middels-høy | Moderat |
| **Små effektive modeller** | GPT-4.1-mini, GPT-4.1-nano, GPT-4o-mini | Høyt volum, sanntid, enklere oppgaver | Lavest | Lavest |
| **Spesialiserte modeller** | Embeddings, Whisper, DALL-E | Embeddings, tale, bilder | Varierer | Varierer |
**Confidence:** Høy (basert på Azure OpenAI-prisside og modellkatalog, feb 2026)
### 2. Token-basert prismodell
Azure OpenAI-tjenester prises per 1 000 tokens (1K) eller 1 million tokens (1M), avhengig av modell:
**GPT-4o mini (eksempel — verifiser på [Azure OpenAI pricing](https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/)):**
- Input: ~$0.15 per 1M tokens
- Output: ~$0.60 per 1M tokens
**GPT-4.1 (eksempel):**
- Input: ~$2.00 per 1M tokens
- Output: ~$8.00 per 1M tokens
**GPT-5 (verifisert juni 2026):**
- Input: $1.25 per 1M tokens (cached $0.125)
- Output: $10.00 per 1M tokens
- Merk: resonnerings-tokens faktureres som output — `high` reasoning_effort kan øke effektiv kost vesentlig
**Viktig:** Rå token-priser eies av det kanoniske registeret (`deterministic-cost-calculation-model.md` §1.1). Sjekk alltid [offisiell prisside](https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/) for eksakte satser per region og modellversjon.
**Confidence:** Moderat (priseksempler fra dokumentasjon, men priser kan variere)
### 3. Deployment-typer og kostnadsimplikasjon
| Deployment-type | Prismodell | Best for | Kostnadspredikabilitet |
|-----------------|------------|----------|------------------------|
| **Standard** | Pay-per-token | Variabelt volum, testing | Lav (avhenger av bruk) |
| **Global Standard** | Pay-per-token (ingen data residency) | Høyt volum, global tilgang | Lav (avhenger av bruk) |
| **Provisioned Throughput (PTU)** | Fast PTU-time-pris | Forutsigbart volum, latens-SLA | Høy (fast kostnad) |
| **Developer Tier (fine-tuning)** | Pay-per-token, ingen hosting-fee | Evaluering, POC (auto-slettes etter 24t) | Lav (midlertidig) |
**PTU-eksempel:**
- 1 PTU = ~5 400 input tokens/minutt for o4-mini
- 1 PTU = ~3 000 input tokens/minutt for GPT-4.1
- PTU-pris varierer per avtale/reservasjon
**Confidence:** Høy (basert på Azure OpenAI deployment-dokumentasjon)
### 4. Fine-tuning kostnadsmønstre
Fine-tunede modeller har tre kostnadsdimensjoner:
| Kostnadselement | Beskrivelse | Eksempel (o4-mini) |
|-----------------|-------------|-------------------|
| **Training** | Per token i treningsfil | ~$1.10 per 1M tokens (input), $4.40 per 1M tokens (output) |
| **Hosting** | Per time deployed modell | $1.70/time (Standard/Global Standard) |
| **Inference** | Per token ved inferens | Samme som base-modell + hosting fee |
**Viktig:** Fine-tunede modeller påløper hosting-kostnad selv om de ikke brukes. Slett ubrukte deployments for å unngå unødvendige kostnader.
**Confidence:** Høy (basert på Azure OpenAI fine-tuning kostnadsdokumentasjon)
---
## Arkitekturmønstre
### Mønster 1: Model Router for dynamisk modellvalg
**Konsept:** Bruk Microsoft Foundry Model Router for å automatisk velge den mest kostnadseffektive modellen basert på prompt-kompleksitet.
**Fordeler:**
- Opptil 60% kostnadsreduksjon vs. alltid-bruk-GPT-5
- Automatisk ruting basert på kompleksitet
- Ingen kodeendringer nødvendig
**Implementering:**
1. Deploy Model Router i Microsoft Foundry
2. Konfigurer underliggende modeller (f.eks. GPT-4.1-nano, GPT-4.1-mini, GPT-4.1)
3. Model Router analyserer prompt og velger passende modell
**Use case:** Chatbots, kundesupport, assistenter med varierende spørsmålskompleksitet
**Confidence:** Høy (Model Router er GA-funksjonalitet i Microsoft Foundry)
### Mønster 2: Tiered model strategy (Small → Medium → Large)
**Konsept:** Kaskaderende modellvalg basert på oppgavetype:
| Tier | Modell | Bruksområde | Kostnad/1M tokens (verifisert juni 2026) |
|------|--------|-------------|------------------------------------------|
| **Tier 1** | GPT-4.1-nano | Enkel triage, klassifisering, korte svar | $0.10 input, $0.40 output |
| **Tier 2** | GPT-4.1-mini | Moderat kompleksitet, standarddrafting | $0.40 input, $1.60 output |
| **Tier 3** | GPT-4.1 / GPT-5-mini | Kompleks analyse, resonnering | GPT-4.1 $2.00/$8.00 · GPT-5-mini $0.25/$2.00 |
**Implementering:**
```python
def select_model(task_complexity: str):
if task_complexity == "simple":
return "gpt-4.1-nano"
elif task_complexity == "moderate":
return "gpt-4.1-mini"
else:
return "gpt-5-mini"
```
**ROI-eksempel:**
- 1 million forespørsler/måned
- 70% simple (Tier 1), 25% moderate (Tier 2), 5% komplekse (Tier 3)
- Estimert besparelse: 50-70% vs. alltid bruke GPT-4.1
**Confidence:** Høy (best practice-mønster dokumentert i Azure-veiledning)
### Mønster 3: Reasoning-nivå optimalisering (GPT-5)
**Konsept:** For GPT-5-modeller, juster reasoning-nivå basert på oppgavekompleksitet.
| Reasoning-nivå | Latens | Kostnad | Nøyaktighet | Bruksområde |
|----------------|--------|---------|-------------|-------------|
| **Minimal** | Raskest | Lavest | Lavest | Bulk-operasjoner, enkle transformasjoner |
| **Low** | Rask | Lav | Moderat | Triage, korte svar, enkle redigeringer |
| **Medium (default)** | Moderat | Middels | God | Innholdsdrafting, moderat koding, RAG Q&A |
| **High** | Sakte | Høyest | Høyest | Kompleks planlegging, analyse, multi-hop reasoning |
**Implementering:**
```python
response = client.responses.create(
model="gpt-5",
reasoning_effort="low", # Juster basert på oppgave
input=[{"role": "user", "content": "Simple query"}]
)
```
**Kostnadssparepotensial:** 40-60% for oppgaver som ikke krever deep reasoning.
**Confidence:** Høy (reasoning-nivåer er dokumentert GPT-5-funksjonalitet)
### Mønster 4: Batch processing for ikke-sanntidsoppgaver
**Konsept:** Bruk batch-prosessering med billigere modeller for oppgaver uten sanntidskrav.
**Fordeler:**
- Lavere kostnader (batch-rabatter hvis tilgjengelig)
- Kan bruke mindre modeller med lengre behandlingstid
- Bedre ressursutnyttelse
**Use case:**
- Nattlig rapportgenerering
- E-postsammendrag
- Innholdsmoderering (ikke-sanntid)
- Databearbeiding
**Confidence:** Moderat (batch processing er best practice, men ikke alltid prisrabattert)
### Mønster 5: Prompt optimization for token-reduksjon
**Konsept:** Reduser token-bruk gjennom prompt-optimalisering:
| Teknikk | Token-besparelse | Implementering |
|---------|------------------|----------------|
| **Fjern verbose instruksjoner** | 10-30% | Konsis prompts, fjern overflødige ord |
| **Few-shot → Zero-shot** | 20-50% | Fjern eksempler hvis modellen håndterer det |
| **Kontekst-komprimering** | 30-60% | Bruk embeddings/semantic search for relevant kontekst |
| **Output length limiting** | Varierer | Sett `max_tokens` eksplisitt |
**ROI-eksempel:**
- Original prompt: 500 tokens input, 200 tokens output
- Optimalisert prompt: 250 tokens input, 150 tokens output
- Token-reduksjon: 50% input, 25% output
- Kostnadssparing: ~40-45% per forespørsel
**Confidence:** Høy (token-optimalisering er best practice)
---
## Beslutningsveiledning
### Beslutningstre for modellvalg
```
START
Krever oppgaven deep reasoning/multi-step logikk?
├─ JA → Velg GPT-5 (juster reasoning-nivå)
└─ NEI → Er latens kritisk (< 200ms)?
├─ JA → Velg GPT-4.1-nano eller GPT-4.1-mini
└─ NEI → Er oppgaven kompleks?
├─ JA → Velg GPT-4.1 eller GPT-4.1-mini
└─ NEI → Velg GPT-4.1-nano (billigste)
```
### Scenario-basert modellanbefaling
| Scenario | Anbefalt modell | Begrunnelse |
|----------|-----------------|-------------|
| **Kundesupport chatbot** | GPT-4.1-mini + Model Router | Balanse mellom kostnad og kvalitet, dynamisk tilpasning |
| **Kodegenerering** | GPT-5-mini (medium reasoning) | Krever resonnering, men ikke maksimal |
| **Dokumentanalyse (juridisk/finans)** | GPT-5 (high reasoning) | Høy nøyaktighet viktigere enn kostnad |
| **E-postklassifisering** | GPT-4.1-nano | Enkel oppgave, høyt volum |
| **RAG-basert Q&A** | GPT-4.1-mini | Moderat kompleksitet, kontekst fra retrieval |
| **Innholdsmoderering** | GPT-4.1-nano + Content Safety | Høyt volum, enkel klassifisering |
| **Enterprise Copilot** | GPT-5 (medium reasoning) + GPT-4.1-mini fallback | Komplekse oppgaver krever resonnering, enkle bruker mini |
**Confidence:** Høy (basert på Microsoft best practices og modellkarakteristikker)
### Kvantitativ ROI-kalkulator (konseptuell)
**Input:**
- Månedlig forespørselsvolum: N
- Gjennomsnittlig input tokens: I
- Gjennomsnittlig output tokens: O
- Nåværende modell: M_current
- Foreslått modell: M_new
**Beregning:**
```
Total tokens/måned = N × (I + O)
Kostnad_current = (I × pris_input_M_current + O × pris_output_M_current) × N / 1 000 000
Kostnad_new = (I × pris_input_M_new + O × pris_output_M_new) × N / 1 000 000
Månedlig besparelse (NOK) = (Kostnad_current - Kostnad_new) × USD_to_NOK
```
**Eksempel:**
- 1M forespørsler/måned, 200 input tokens, 100 output tokens
- Current: GPT-4.1 ($2.00 input, $8.00 output per 1M tokens)
- New: GPT-4.1-mini ($1.00 input, $4.00 output per 1M tokens)
- Kostnad_current = (200 × $2.00 + 100 × $8.00) × 1 / 1000 = $1 200
- Kostnad_new = (200 × $1.00 + 100 × $4.00) × 1 / 1000 = $600
- Besparelse: $600/måned (~6 600 NOK/måned ved USD 1 = NOK 11)
**Confidence:** Moderat (priseksempler er illustrative, faktiske priser varierer)
---
## Integrasjon med Microsoft-stakken
### Microsoft Foundry Model Catalog
**Tilgang til modellkatalog:**
1. Gå til [Microsoft Foundry](https://ai.azure.com)
2. Velg **Model Catalog** i venstre meny
3. Filtrer på "Azure OpenAI" for Microsoft-modeller
4. Sammenlign modeller basert på:
- Input/output token-priser
- Context window size
- Capabilities (vision, function calling, etc.)
- Regional tilgjengelighet
**Confidence:** Høy (Microsoft Foundry er GA)
### Azure Cost Management + Budgets
**Integrasjon for kostnadssporing:**
| Funksjon | Beskrivelse | Verdi |
|----------|-------------|-------|
| **Cost Analysis** | Per-modell kostnadsinnsikt via deployment tags | Identifiser dyreste modeller |
| **Budgets + Alerts** | Varsler ved kostnadsterskler | Forhindre budsjettoverskridelser |
| **Export til Storage** | Daglig/ukentlig kostnadseksport | Dypere analyse i Power BI/Excel |
**Implementering:**
1. Gå til Azure Portal → Cost Management
2. Opprett budget scoped til resource group
3. Sett alerts ved 50%, 75%, 90% av budsjett
4. Grupper kostnader etter "Meter" for å se per-modell kostnad
**Confidence:** Høy (Cost Management er standard Azure-funksjonalitet)
### Power Platform AI Builder
**Modellvalg i AI Builder:**
- AI Builder / prompt builder bruker **GPT-4.1 mini** som standardmodell for generative oppgaver (GPT-4o mini og GPT-4o brukes nå kun i US government-regioner)
- Ingen direkte modellvalg tilgjengelig i AI Builder-grensesnittet
- Kostnader inkludert i AI Builder credits (500 credits/bruker/måned i premium-planer)
**Optimalisering:**
- Begrens prompt-lengde
- Bruk structured outputs for å redusere token-bruk
**Confidence:** Moderat (basert på Power Platform dokumentasjon)
### Copilot Studio
**Modellstrategi i Copilot Studio:**
- Copilot Studio bruker Azure OpenAI-modeller (GPT-4o eller GPT-4.1-serien)
- Licenskostnad dekker inferenskostnader (per Q2 2024)
- Vurder Generative Answers vs. custom topics for kostnadskontroll
**Optimalisering:**
- Bruk Boosted Conversations kun når nødvendig
- Optimaliser Generative Answers med tydelige fallback-scenarier
**Confidence:** Moderat (Copilot Studio-lisensiering kan endre seg)
---
## Offentlig sektor (Norge)
### Kostnadskontroll i offentlige anskaffelser
**Krav til kostnadstransparens:**
- Offentlige virksomheter må kunne dokumentere kostnader per tjeneste/bruker
- Azure Cost Management gir nødvendig sporbarhet
- Tagging-strategi anbefales: `project`, `department`, `cost-center`
**Anbefaling:**
- Etabler månedlig kostnadsrapportering per prosjekt
- Bruk PTU (Provisioned Throughput) for forutsigbare budsjetter i produksjon
- Test med Standard deployment, migrer til PTU ved stabil bruk
**Confidence:** Høy (basert på generell offentlig sektor best practice)
### Compliance og dataplassering
**Kostnad vs. compliance:**
- **Standard deployment** (regional): Høyere kostnad, garantert data residency i Norge
- **Global Standard**: Lavere kostnad, ingen data residency-garanti
**Anbefaling for offentlig sektor:**
- Velg **Standard deployment i Norway East** for personopplysninger (GDPR)
- Vurder Global Standard for ikke-sensitive workloads (potensielt 10-20% billigere)
**Confidence:** Høy (basert på Azure OpenAI deployment-dokumentasjon)
### TCO for offentlig AI-satsning
**Total Cost of Ownership-komponenter:**
| Kostnadselement | Estimat (årlig, små prosjekter) | Optimalisering |
|-----------------|----------------------------------|----------------|
| **Azure OpenAI inferens** | 50 000 - 200 000 NOK | Modellvalg, prompt-optimalisering |
| **Azure AI Search (RAG)** | 30 000 - 100 000 NOK | Indeksoptimalisering, partitioning |
| **Azure Storage** | 5 000 - 20 000 NOK | Lifecycle policies |
| **Azure Monitor/App Insights** | 10 000 - 30 000 NOK | Sampling, log retention |
| **Lisenser (Copilot Studio)** | 200 - 2 000 NOK/bruker/måned | Pilot med få brukere først |
**Total estimert TCO (små prosjekter):** 100 000 - 500 000 NOK/år (ekskl. personellkostnader)
**Confidence:** Lav-Moderat (estimater er generelle, varierer betydelig per use case)
---
## Kostnad og lisensiering
### Lisensmodeller for Microsoft AI
| Produkt | Lisensmodell | AI-kostnad inkludert? | Ekstra kostnad |
|---------|--------------|------------------------|----------------|
| **Azure OpenAI** | Pay-per-token eller PTU | Nei | Basert på bruk eller PTU-reservasjon |
| **Copilot Studio** | Per bruker/måned (~$200/måned) | Ja (inferens inkludert) | Økt bruk kan koste ekstra |
| **Power Platform (premium)** | Per bruker/måned (~$40/bruker) | Delvis (500 AI Builder credits/bruker) | Ytterligere credits må kjøpes |
| **M365 Copilot** | Per bruker/måned (~$360/bruker) | Ja (inferens inkludert) | Ingen ekstra kostnad |
**Viktig:** Priser er illustrative per januar 2026. Verifiser på [Microsoft lisensside](https://www.microsoft.com/licensing/).
**Confidence:** Moderat (lisenser endres regelmessig)
### Cost avoidance-strategier
| Strategi | Potensial besparelse | Kompleksitet |
|----------|----------------------|--------------|
| **Bytt fra GPT-4.1 til GPT-4.1-mini** | 50% | Lav (krever testing) |
| **Bruk Model Router** | 30-60% | Middels (Microsoft Foundry-setup) |
| **Prompt-optimalisering** | 20-40% | Lav (kan gjøres iterativt) |
| **Fine-tuning for å erstatte større modell** | 40-70% | Høy (krever treningsdata og vedlikehold) |
| **Migrering til PTU (ved høyt volum)** | 20-50% | Middels (krever volumprediksjon) |
| **Caching (for repeterende prompts)** | 10-30% | Lav-Middels (krever cache-logikk) |
**Confidence:** Moderat (besparelsespotensial varierer per use case)
### Regional prisvariasjoner
**Eksempel (verifiser på Azure-prisside):**
- Norway East: Standard pricing
- West Europe: Standard pricing
- East US: ~5-10% billigere (ikke-europeisk region)
**Anbefaling for norske virksomheter:**
- Bruk Norway East for compliance-sensitive data
- Vurder West Europe for ikke-sensitive workloads (latens vs. kostnad)
**Confidence:** Moderat (prisvariasjon finnes, men er ofte marginal)
---
## For arkitekten (Cosmo)
### Når bruke denne referansen
**Triggers:**
- Bruker spør: "Hvilken modell bør jeg bruke for [use case]?"
- Bruker ønsker kostnadsoptimalisering av eksisterende løsning
- Bruker planlegger høyvolum-deployment og er bekymret for kostnad
- Bruker vil sammenligne GPT-4o-mini vs. GPT-4.1 vs. GPT-5
### Rådgivningsprosess
**1. Forstå use case:**
- Hva skal modellen gjøre? (klassifisering, generering, resonnering)
- Hva er volumet? (forespørsler/dag, tokens per forespørsel)
- Hva er latenskrav? (sanntid vs. batch)
**2. Foreslå modellstrategi:**
- Bruk beslutningstreet i "Beslutningsveiledning"
- Anbefal tiered approach hvis varierende kompleksitet
- Vurder Model Router for dynamisk ruting
**3. Estimer kostnader:**
- Bruk ROI-kalkulatoren (konseptuell seksjon)
- Sammenlign nåværende vs. foreslått modell
- Inkluder TCO (ikke bare inferenskostnad)
**4. Anbefal testing:**
- "Start med GPT-4.1-mini, evaluer kvalitet"
- "Opprett evaluation dataset for sammenligning"
- "Test i 1-2 uker før full rollout"
**5. Oppfølging:**
- Sett opp Cost Management alerts
- Følg opp med Azure Monitor for ytelsesmetrikker
- Juster modellvalg basert på faktisk bruk
### Typiske spørsmål og svar
**Q: "Skal jeg alltid bruke billigste modell?"**
**A:** Nei. Velg den minste modellen som oppfyller kvalitetskravene. Hvis GPT-4.1-nano gir 70% kvalitet men GPT-4.1-mini gir 95%, kan ekstra kostnad være verdt det.
**Q: "Hvordan vet jeg om GPT-4.1-mini er god nok vs. GPT-4.1?"**
**A:** Opprett et evaluation dataset (50-100 representative eksempler), kjør begge modeller, sammenlign output. Bruk Microsoft Foundry evaluations for strukturert testing.
**Q: "Er fine-tuning alltid billigere?"**
**A:** Nei. Fine-tuning har opfront-kostnad (training) og hosting-kostnad ($1.70/time). Kun kostnadseffektivt ved høyt volum (>100K forespørsler/måned) eller hvis du kan erstatte GPT-4.1 med fine-tuned GPT-4.1-mini.
**Q: "Hvordan optimalisere kostnader for RAG-løsning?"**
**A:**
1. Bruk semantic search for å redusere kontekst-tokens
2. Velg GPT-4.1-mini for spørsmål med god retrieval
3. Fallback til GPT-4.1 hvis ikke confident svar
4. Optimaliser chunking-strategi i Azure AI Search
### Confidence markers i rådgivning
Bruk alltid confidence markers når du anbefaler modeller:
- **Høy confidence:** "GPT-4.1-mini er dokumentert 50% billigere enn GPT-4.1 for samme deployment-type."
- **Moderat confidence:** "Basert på lignende use cases, forventer jeg 30-50% kostnadsreduksjon."
- **Lav confidence:** "Uten å teste på ditt spesifikke dataset, er det vanskelig å si om GPT-4.1-nano vil være tilstrekkelig."
### Verktøy for kostnadsestimering
**Anbefal alltid:**
1. [Azure Pricing Calculator](https://azure.microsoft.com/pricing/calculator/) for estimering
2. [Microsoft Foundry Calculator](https://ai.azure.com/resource/calculator) for PTU-estimering
3. Azure Cost Management for faktisk kostnadssporing
### Vanlige fallgruver
| Fallgruve | Konsekvens | Hvordan unngå |
|-----------|------------|---------------|
| **Alltid bruke GPT-5** | 3-5x høyere kostnad | Vurder GPT-4.1-mini eller GPT-4.1 først |
| **Glemme hosting-kostnad for fine-tuning** | $1.70/time × 24 × 30 = $1 224/måned | Slett ubrukte fine-tuned deployments |
| **Ikke sette max_tokens** | Unødvendig lange svar = høyere output-kostnad | Sett `max_tokens` eksplisitt |
| **Bruke Standard over Global Standard uten grunn** | 10-20% høyere kostnad | Velg Global Standard hvis data residency ikke kreves |
| **Ikke monitere kostnader** | Uventede regninger | Sett opp Cost Management alerts |
---
## Kilder og verifisering
### Primærkilder (Microsoft Learn)
1. **GPT-5 vs GPT-4.1: choosing the right model for your use case**
URL: https://learn.microsoft.com/en-us/azure/foundry/foundry-models/how-to/model-choice-guide?view=foundry-classic
Hentet: 2026-02
Innhold: Modellsammenligninger, latency trade-offs, reasoning-nivåer
2. **Plan to manage costs for Azure OpenAI in Foundry Models**
URL: https://learn.microsoft.com/en-us/azure/foundry/concepts/manage-costs
Hentet: 2026-02
Innhold: Billing models, token pricing, cost monitoring
3. **Cost management for fine-tuning**
URL: https://learn.microsoft.com/en-us/azure/foundry/openai/how-to/fine-tuning-cost-management?view=foundry-classic
Hentet: 2026-02
Innhold: Training costs, hosting costs, deployment types
4. **Optimize model cost and performance**
URL: https://learn.microsoft.com/en-us/azure/foundry/control-plane/how-to-optimize-cost-performance?view=foundry
Hentet: 2026-02
Innhold: Model Router, cost optimization workflows
5. **Azure OpenAI in Foundry Models**
URL: https://learn.microsoft.com/en-us/azure/foundry/foundry-models/concepts/models-sold-directly-by-azure
Hentet: 2026-02
Innhold: Model catalog, capabilities, regional availability
6. **Understanding costs associated with provisioned throughput units (PTU)**
URL: https://learn.microsoft.com/en-us/azure/foundry/openai/concepts/provisioned-throughput-billing
Hentet: 2026-02
Innhold: PTU pricing, throughput per PTU, when to use PTU
### Sekundærkilder
7. **Azure OpenAI Pricing Page**
URL: https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/
Note: Offisiell prisside (sjekk for oppdaterte priser)
8. **Azure Pricing Calculator**
URL: https://azure.microsoft.com/pricing/calculator/
Note: For pre-deployment estimering
9. **Microsoft Foundry Calculator**
URL: https://ai.azure.com/resource/calculator
Note: For PTU-estimering
### Verifiseringsstatus
| Påstand | Kilde | Confidence |
|---------|-------|------------|
| GPT-4.1-mini er 50% billigere enn GPT-4.1 | Source 2, illustrative pricing examples | Høy |
| Model Router kan spare opptil 60% | Source 4 | Høy |
| Fine-tuning hosting cost er $1.70/time | Source 3 | Høy |
| GPT-5 har fire reasoning-nivåer | Source 1 | Høy |
| PTU gir 3 000 input TPM per PTU for GPT-4.1 | Source 6 | Høy |
**Totalt antall kilder:** 9 (6 primære Microsoft Learn-artikler, 3 pricing-referanser)
**MCP-kall brukt:** 6 (4x docs_search, 2x docs_fetch)
### Siste oppdatering og gyldighet
**Dokumentasjonsdato:** Januar-februar 2026; modell-enumerasjon oppdatert 2026-06
**Priser gyldige per:** Februar 2026 (illustrative — verifiser alltid på offisiell prisside)
**Modeller i GA (per 2026-06):** GPT-4.1-serien, GPT-4o/GPT-4o-mini, o-serien (o1/o3/o3-mini/o4-mini), og GPT-5-generasjonen: GPT-5/-mini/-nano (2025-08), GPT-5.1 (2025-11-13), GPT-5.2 (2025-12-11), GPT-5.3-codex/-chat (2026-02/03), GPT-5.4 + GPT-5.4-pro (2026-03-05), GPT-5.5 (2026-04-24), gpt-chat-latest (2026-05, preview). Snapshotten over (GPT-5 / GPT-4.1 / GPT-4o-mini) er én generasjon bak — GPT-5.1→5.5 finnes nå. Full, region-verifisert modellkatalog: `model-catalog-2026.md`.
**Neste review anbefalt:** Q4 2026 (Microsoft oppdaterer priser kvartalsvis)
---
**Dokumenteier:** Cosmo Skyberg, Microsoft AI Solution Architect
**Godkjent for:** Offentlig sektor Norge, Enterprise Azure-kunder
**Versjon:** 1.0