Steg 9 (R4): unified migrate-corpus.mjs --write over engineering/governance/ infrastructure/security. 327 filer mutert, verified=null, prosa byte-identisk (fra første ## seksjon), advisor urørt (0 endringer). To applier-fixes oppdaget under kjøring (TDD, RED→GREEN): - insertHeaderFields: anker faller nå tilbake når en meta-linje selv passerer 500B (2 filer pakket et avsnitt i **Status:** → Type/Source landet utenfor scan-vinduet, applierens post-write-assertion fanget + restaurerte). - normalizeStaleVerified: fjerner nå ALLE stale non-date **Verified:** i 500B-vinduet, inkl. stray body-dup rett under --- (9 mlops-genaiops-filer var ellers falskt "verified"/fresh, droppet fra worklist). Operatør-godkjent utvidelse av carve-out; kun stray metadata-linjer, aldri prosa. test-transform-criterion: precondition oppdatert til post-migrasjons-sannhet (fila bærer nå Source). Suite 728/728 grønn.
583 lines
25 KiB
Markdown
583 lines
25 KiB
Markdown
# Model Selection for Cost-Efficiency
|
||
|
||
**Last updated:** 2026-06
|
||
**Status:** GA
|
||
**Category:** Cost Optimization & FinOps for AI
|
||
**Source:** https://learn.microsoft.com/azure/foundry/foundry-models/concepts/models-sold-directly-by-azure
|
||
**Type:** reference
|
||
|
||
---
|
||
|
||
## Innhold
|
||
|
||
- [Introduksjon](#introduksjon)
|
||
- [Kjernekomponenter](#kjernekomponenter)
|
||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||
|
||
## Introduksjon
|
||
|
||
Valg av AI-modell har direkte innvirkning på både ytelse og kostnad. Microsoft Azure AI tilbyr et bredt spekter av modeller med ulike pris-/ytelsekarakteristikker — fra små, kostnadseffektive modeller som GPT-4o mini og GPT-4.1-nano, til store resonneringsmodeller som GPT-5. Riktig modellvalg kan redusere kostnader med 60-80% uten å ofre kvalitet for det aktuelle bruksområdet.
|
||
|
||
> **Merk (2026-06):** Denne referansens modelleksempler (GPT-5 / GPT-4.1 / GPT-4o-mini) er én generasjon bak. GPT-5-generasjonen er nå utvidet til GPT-5.1→5.5 (jf. `models-sold-directly-by-azure`). Pris-/ytelsesprinsippene under er fortsatt gyldige, men ved konkret modellvalg: bruk den region-verifiserte `model-catalog-2026.md`.
|
||
|
||
**Confidence:** Høy (basert på offisiell Microsoft-dokumentasjon, jan 2026)
|
||
|
||
Denne referansen gir strukturert veiledning for å velge mest kostnadseffektive modell basert på:
|
||
- Arbeidsbelastningens kompleksitet (reasoning vs. hurtige svar)
|
||
- Latenskrav (sanntid vs. batch)
|
||
- Volum (tokens per minutt, forespørsler per minutt)
|
||
- Budsjettrammer
|
||
|
||
**Nøkkelprinsipp:** Velg den minste modellen som oppfyller kvalitetskravene dine. Større modeller = høyere kostnader per token.
|
||
|
||
---
|
||
|
||
## Kjernekomponenter
|
||
|
||
### 1. Modellklasser og prisposisjonering
|
||
|
||
Microsoft Azure AI-plattformen tilbyr flere modellklasser med distinkte pris-/ytelsekarakteristikker:
|
||
|
||
| Modellklasse | Eksempler | Bruksområde | Relativ kostnad | Latens |
|
||
|--------------|-----------|-------------|-----------------|--------|
|
||
| **Resonneringsmodeller** | GPT-5, GPT-5-mini, GPT-5-nano | Kompleks analyse, multi-steg logikk, planlegging | Høyest | Høyere |
|
||
| **Store generelle modeller** | GPT-4.1, GPT-4o | Balansert ytelse, generelle oppgaver | Middels-høy | Moderat |
|
||
| **Små effektive modeller** | GPT-4.1-mini, GPT-4.1-nano, GPT-4o-mini | Høyt volum, sanntid, enklere oppgaver | Lavest | Lavest |
|
||
| **Spesialiserte modeller** | Embeddings, Whisper, DALL-E | Embeddings, tale, bilder | Varierer | Varierer |
|
||
|
||
**Confidence:** Høy (basert på Azure OpenAI-prisside og modellkatalog, feb 2026)
|
||
|
||
### 2. Token-basert prismodell
|
||
|
||
Azure OpenAI-tjenester prises per 1 000 tokens (1K) eller 1 million tokens (1M), avhengig av modell:
|
||
|
||
**GPT-4o mini (eksempel — verifiser på [Azure OpenAI pricing](https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/)):**
|
||
- Input: ~$0.15 per 1M tokens
|
||
- Output: ~$0.60 per 1M tokens
|
||
|
||
**GPT-4.1 (eksempel):**
|
||
- Input: ~$2.00 per 1M tokens
|
||
- Output: ~$8.00 per 1M tokens
|
||
|
||
**GPT-5 (verifisert juni 2026):**
|
||
- Input: $1.25 per 1M tokens (cached $0.125)
|
||
- Output: $10.00 per 1M tokens
|
||
- Merk: resonnerings-tokens faktureres som output — `high` reasoning_effort kan øke effektiv kost vesentlig
|
||
|
||
**Viktig:** Rå token-priser eies av det kanoniske registeret (`deterministic-cost-calculation-model.md` §1.1). Sjekk alltid [offisiell prisside](https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/) for eksakte satser per region og modellversjon.
|
||
|
||
**Confidence:** Moderat (priseksempler fra dokumentasjon, men priser kan variere)
|
||
|
||
### 3. Deployment-typer og kostnadsimplikasjon
|
||
|
||
| Deployment-type | Prismodell | Best for | Kostnadspredikabilitet |
|
||
|-----------------|------------|----------|------------------------|
|
||
| **Standard** | Pay-per-token | Variabelt volum, testing | Lav (avhenger av bruk) |
|
||
| **Global Standard** | Pay-per-token (ingen data residency) | Høyt volum, global tilgang | Lav (avhenger av bruk) |
|
||
| **Provisioned Throughput (PTU)** | Fast PTU-time-pris | Forutsigbart volum, latens-SLA | Høy (fast kostnad) |
|
||
| **Developer Tier (fine-tuning)** | Pay-per-token, ingen hosting-fee | Evaluering, POC (auto-slettes etter 24t) | Lav (midlertidig) |
|
||
|
||
**PTU-eksempel:**
|
||
- 1 PTU = ~5 400 input tokens/minutt for o4-mini
|
||
- 1 PTU = ~3 000 input tokens/minutt for GPT-4.1
|
||
- PTU-pris varierer per avtale/reservasjon
|
||
|
||
**Confidence:** Høy (basert på Azure OpenAI deployment-dokumentasjon)
|
||
|
||
### 4. Fine-tuning kostnadsmønstre
|
||
|
||
Fine-tunede modeller har tre kostnadsdimensjoner:
|
||
|
||
| Kostnadselement | Beskrivelse | Eksempel (o4-mini) |
|
||
|-----------------|-------------|-------------------|
|
||
| **Training** | Per token i treningsfil | ~$1.10 per 1M tokens (input), $4.40 per 1M tokens (output) |
|
||
| **Hosting** | Per time deployed modell | $1.70/time (Standard/Global Standard) |
|
||
| **Inference** | Per token ved inferens | Samme som base-modell + hosting fee |
|
||
|
||
**Viktig:** Fine-tunede modeller påløper hosting-kostnad selv om de ikke brukes. Slett ubrukte deployments for å unngå unødvendige kostnader.
|
||
|
||
**Confidence:** Høy (basert på Azure OpenAI fine-tuning kostnadsdokumentasjon)
|
||
|
||
---
|
||
|
||
## Arkitekturmønstre
|
||
|
||
### Mønster 1: Model Router for dynamisk modellvalg
|
||
|
||
**Konsept:** Bruk Microsoft Foundry Model Router for å automatisk velge den mest kostnadseffektive modellen basert på prompt-kompleksitet.
|
||
|
||
**Fordeler:**
|
||
- Opptil 60% kostnadsreduksjon vs. alltid-bruk-GPT-5
|
||
- Automatisk ruting basert på kompleksitet
|
||
- Ingen kodeendringer nødvendig
|
||
|
||
**Implementering:**
|
||
1. Deploy Model Router i Microsoft Foundry
|
||
2. Konfigurer underliggende modeller (f.eks. GPT-4.1-nano, GPT-4.1-mini, GPT-4.1)
|
||
3. Model Router analyserer prompt og velger passende modell
|
||
|
||
**Use case:** Chatbots, kundesupport, assistenter med varierende spørsmålskompleksitet
|
||
|
||
**Confidence:** Høy (Model Router er GA-funksjonalitet i Microsoft Foundry)
|
||
|
||
### Mønster 2: Tiered model strategy (Small → Medium → Large)
|
||
|
||
**Konsept:** Kaskaderende modellvalg basert på oppgavetype:
|
||
|
||
| Tier | Modell | Bruksområde | Kostnad/1M tokens (verifisert juni 2026) |
|
||
|------|--------|-------------|------------------------------------------|
|
||
| **Tier 1** | GPT-4.1-nano | Enkel triage, klassifisering, korte svar | $0.10 input, $0.40 output |
|
||
| **Tier 2** | GPT-4.1-mini | Moderat kompleksitet, standarddrafting | $0.40 input, $1.60 output |
|
||
| **Tier 3** | GPT-4.1 / GPT-5-mini | Kompleks analyse, resonnering | GPT-4.1 $2.00/$8.00 · GPT-5-mini $0.25/$2.00 |
|
||
|
||
**Implementering:**
|
||
```python
|
||
def select_model(task_complexity: str):
|
||
if task_complexity == "simple":
|
||
return "gpt-4.1-nano"
|
||
elif task_complexity == "moderate":
|
||
return "gpt-4.1-mini"
|
||
else:
|
||
return "gpt-5-mini"
|
||
```
|
||
|
||
**ROI-eksempel:**
|
||
- 1 million forespørsler/måned
|
||
- 70% simple (Tier 1), 25% moderate (Tier 2), 5% komplekse (Tier 3)
|
||
- Estimert besparelse: 50-70% vs. alltid bruke GPT-4.1
|
||
|
||
**Confidence:** Høy (best practice-mønster dokumentert i Azure-veiledning)
|
||
|
||
### Mønster 3: Reasoning-nivå optimalisering (GPT-5)
|
||
|
||
**Konsept:** For GPT-5-modeller, juster reasoning-nivå basert på oppgavekompleksitet.
|
||
|
||
| Reasoning-nivå | Latens | Kostnad | Nøyaktighet | Bruksområde |
|
||
|----------------|--------|---------|-------------|-------------|
|
||
| **Minimal** | Raskest | Lavest | Lavest | Bulk-operasjoner, enkle transformasjoner |
|
||
| **Low** | Rask | Lav | Moderat | Triage, korte svar, enkle redigeringer |
|
||
| **Medium (default)** | Moderat | Middels | God | Innholdsdrafting, moderat koding, RAG Q&A |
|
||
| **High** | Sakte | Høyest | Høyest | Kompleks planlegging, analyse, multi-hop reasoning |
|
||
|
||
**Implementering:**
|
||
```python
|
||
response = client.responses.create(
|
||
model="gpt-5",
|
||
reasoning_effort="low", # Juster basert på oppgave
|
||
input=[{"role": "user", "content": "Simple query"}]
|
||
)
|
||
```
|
||
|
||
**Kostnadssparepotensial:** 40-60% for oppgaver som ikke krever deep reasoning.
|
||
|
||
**Confidence:** Høy (reasoning-nivåer er dokumentert GPT-5-funksjonalitet)
|
||
|
||
### Mønster 4: Batch processing for ikke-sanntidsoppgaver
|
||
|
||
**Konsept:** Bruk batch-prosessering med billigere modeller for oppgaver uten sanntidskrav.
|
||
|
||
**Fordeler:**
|
||
- Lavere kostnader (batch-rabatter hvis tilgjengelig)
|
||
- Kan bruke mindre modeller med lengre behandlingstid
|
||
- Bedre ressursutnyttelse
|
||
|
||
**Use case:**
|
||
- Nattlig rapportgenerering
|
||
- E-postsammendrag
|
||
- Innholdsmoderering (ikke-sanntid)
|
||
- Databearbeiding
|
||
|
||
**Confidence:** Moderat (batch processing er best practice, men ikke alltid prisrabattert)
|
||
|
||
### Mønster 5: Prompt optimization for token-reduksjon
|
||
|
||
**Konsept:** Reduser token-bruk gjennom prompt-optimalisering:
|
||
|
||
| Teknikk | Token-besparelse | Implementering |
|
||
|---------|------------------|----------------|
|
||
| **Fjern verbose instruksjoner** | 10-30% | Konsis prompts, fjern overflødige ord |
|
||
| **Few-shot → Zero-shot** | 20-50% | Fjern eksempler hvis modellen håndterer det |
|
||
| **Kontekst-komprimering** | 30-60% | Bruk embeddings/semantic search for relevant kontekst |
|
||
| **Output length limiting** | Varierer | Sett `max_tokens` eksplisitt |
|
||
|
||
**ROI-eksempel:**
|
||
- Original prompt: 500 tokens input, 200 tokens output
|
||
- Optimalisert prompt: 250 tokens input, 150 tokens output
|
||
- Token-reduksjon: 50% input, 25% output
|
||
- Kostnadssparing: ~40-45% per forespørsel
|
||
|
||
**Confidence:** Høy (token-optimalisering er best practice)
|
||
|
||
---
|
||
|
||
## Beslutningsveiledning
|
||
|
||
### Beslutningstre for modellvalg
|
||
|
||
```
|
||
START
|
||
↓
|
||
Krever oppgaven deep reasoning/multi-step logikk?
|
||
├─ JA → Velg GPT-5 (juster reasoning-nivå)
|
||
└─ NEI → Er latens kritisk (< 200ms)?
|
||
├─ JA → Velg GPT-4.1-nano eller GPT-4.1-mini
|
||
└─ NEI → Er oppgaven kompleks?
|
||
├─ JA → Velg GPT-4.1 eller GPT-4.1-mini
|
||
└─ NEI → Velg GPT-4.1-nano (billigste)
|
||
```
|
||
|
||
### Scenario-basert modellanbefaling
|
||
|
||
| Scenario | Anbefalt modell | Begrunnelse |
|
||
|----------|-----------------|-------------|
|
||
| **Kundesupport chatbot** | GPT-4.1-mini + Model Router | Balanse mellom kostnad og kvalitet, dynamisk tilpasning |
|
||
| **Kodegenerering** | GPT-5-mini (medium reasoning) | Krever resonnering, men ikke maksimal |
|
||
| **Dokumentanalyse (juridisk/finans)** | GPT-5 (high reasoning) | Høy nøyaktighet viktigere enn kostnad |
|
||
| **E-postklassifisering** | GPT-4.1-nano | Enkel oppgave, høyt volum |
|
||
| **RAG-basert Q&A** | GPT-4.1-mini | Moderat kompleksitet, kontekst fra retrieval |
|
||
| **Innholdsmoderering** | GPT-4.1-nano + Content Safety | Høyt volum, enkel klassifisering |
|
||
| **Enterprise Copilot** | GPT-5 (medium reasoning) + GPT-4.1-mini fallback | Komplekse oppgaver krever resonnering, enkle bruker mini |
|
||
|
||
**Confidence:** Høy (basert på Microsoft best practices og modellkarakteristikker)
|
||
|
||
### Kvantitativ ROI-kalkulator (konseptuell)
|
||
|
||
**Input:**
|
||
- Månedlig forespørselsvolum: N
|
||
- Gjennomsnittlig input tokens: I
|
||
- Gjennomsnittlig output tokens: O
|
||
- Nåværende modell: M_current
|
||
- Foreslått modell: M_new
|
||
|
||
**Beregning:**
|
||
```
|
||
Total tokens/måned = N × (I + O)
|
||
Kostnad_current = (I × pris_input_M_current + O × pris_output_M_current) × N / 1 000 000
|
||
Kostnad_new = (I × pris_input_M_new + O × pris_output_M_new) × N / 1 000 000
|
||
Månedlig besparelse (NOK) = (Kostnad_current - Kostnad_new) × USD_to_NOK
|
||
```
|
||
|
||
**Eksempel:**
|
||
- 1M forespørsler/måned, 200 input tokens, 100 output tokens
|
||
- Current: GPT-4.1 ($2.00 input, $8.00 output per 1M tokens)
|
||
- New: GPT-4.1-mini ($1.00 input, $4.00 output per 1M tokens)
|
||
- Kostnad_current = (200 × $2.00 + 100 × $8.00) × 1 / 1000 = $1 200
|
||
- Kostnad_new = (200 × $1.00 + 100 × $4.00) × 1 / 1000 = $600
|
||
- Besparelse: $600/måned (~6 600 NOK/måned ved USD 1 = NOK 11)
|
||
|
||
**Confidence:** Moderat (priseksempler er illustrative, faktiske priser varierer)
|
||
|
||
---
|
||
|
||
## Integrasjon med Microsoft-stakken
|
||
|
||
### Microsoft Foundry Model Catalog
|
||
|
||
**Tilgang til modellkatalog:**
|
||
1. Gå til [Microsoft Foundry](https://ai.azure.com)
|
||
2. Velg **Model Catalog** i venstre meny
|
||
3. Filtrer på "Azure OpenAI" for Microsoft-modeller
|
||
4. Sammenlign modeller basert på:
|
||
- Input/output token-priser
|
||
- Context window size
|
||
- Capabilities (vision, function calling, etc.)
|
||
- Regional tilgjengelighet
|
||
|
||
**Confidence:** Høy (Microsoft Foundry er GA)
|
||
|
||
### Azure Cost Management + Budgets
|
||
|
||
**Integrasjon for kostnadssporing:**
|
||
|
||
| Funksjon | Beskrivelse | Verdi |
|
||
|----------|-------------|-------|
|
||
| **Cost Analysis** | Per-modell kostnadsinnsikt via deployment tags | Identifiser dyreste modeller |
|
||
| **Budgets + Alerts** | Varsler ved kostnadsterskler | Forhindre budsjettoverskridelser |
|
||
| **Export til Storage** | Daglig/ukentlig kostnadseksport | Dypere analyse i Power BI/Excel |
|
||
|
||
**Implementering:**
|
||
1. Gå til Azure Portal → Cost Management
|
||
2. Opprett budget scoped til resource group
|
||
3. Sett alerts ved 50%, 75%, 90% av budsjett
|
||
4. Grupper kostnader etter "Meter" for å se per-modell kostnad
|
||
|
||
**Confidence:** Høy (Cost Management er standard Azure-funksjonalitet)
|
||
|
||
### Power Platform AI Builder
|
||
|
||
**Modellvalg i AI Builder:**
|
||
- AI Builder / prompt builder bruker **GPT-4.1 mini** som standardmodell for generative oppgaver (GPT-4o mini og GPT-4o brukes nå kun i US government-regioner)
|
||
- Ingen direkte modellvalg tilgjengelig i AI Builder-grensesnittet
|
||
- Kostnader inkludert i AI Builder credits (500 credits/bruker/måned i premium-planer)
|
||
|
||
**Optimalisering:**
|
||
- Begrens prompt-lengde
|
||
- Bruk structured outputs for å redusere token-bruk
|
||
|
||
**Confidence:** Moderat (basert på Power Platform dokumentasjon)
|
||
|
||
### Copilot Studio
|
||
|
||
**Modellstrategi i Copilot Studio:**
|
||
- Copilot Studio bruker Azure OpenAI-modeller (GPT-4o eller GPT-4.1-serien)
|
||
- Licenskostnad dekker inferenskostnader (per Q2 2024)
|
||
- Vurder Generative Answers vs. custom topics for kostnadskontroll
|
||
|
||
**Optimalisering:**
|
||
- Bruk Boosted Conversations kun når nødvendig
|
||
- Optimaliser Generative Answers med tydelige fallback-scenarier
|
||
|
||
**Confidence:** Moderat (Copilot Studio-lisensiering kan endre seg)
|
||
|
||
---
|
||
|
||
## Offentlig sektor (Norge)
|
||
|
||
### Kostnadskontroll i offentlige anskaffelser
|
||
|
||
**Krav til kostnadstransparens:**
|
||
- Offentlige virksomheter må kunne dokumentere kostnader per tjeneste/bruker
|
||
- Azure Cost Management gir nødvendig sporbarhet
|
||
- Tagging-strategi anbefales: `project`, `department`, `cost-center`
|
||
|
||
**Anbefaling:**
|
||
- Etabler månedlig kostnadsrapportering per prosjekt
|
||
- Bruk PTU (Provisioned Throughput) for forutsigbare budsjetter i produksjon
|
||
- Test med Standard deployment, migrer til PTU ved stabil bruk
|
||
|
||
**Confidence:** Høy (basert på generell offentlig sektor best practice)
|
||
|
||
### Compliance og dataplassering
|
||
|
||
**Kostnad vs. compliance:**
|
||
- **Standard deployment** (regional): Høyere kostnad, garantert data residency i Norge
|
||
- **Global Standard**: Lavere kostnad, ingen data residency-garanti
|
||
|
||
**Anbefaling for offentlig sektor:**
|
||
- Velg **Standard deployment i Norway East** for personopplysninger (GDPR)
|
||
- Vurder Global Standard for ikke-sensitive workloads (potensielt 10-20% billigere)
|
||
|
||
**Confidence:** Høy (basert på Azure OpenAI deployment-dokumentasjon)
|
||
|
||
### TCO for offentlig AI-satsning
|
||
|
||
**Total Cost of Ownership-komponenter:**
|
||
|
||
| Kostnadselement | Estimat (årlig, små prosjekter) | Optimalisering |
|
||
|-----------------|----------------------------------|----------------|
|
||
| **Azure OpenAI inferens** | 50 000 - 200 000 NOK | Modellvalg, prompt-optimalisering |
|
||
| **Azure AI Search (RAG)** | 30 000 - 100 000 NOK | Indeksoptimalisering, partitioning |
|
||
| **Azure Storage** | 5 000 - 20 000 NOK | Lifecycle policies |
|
||
| **Azure Monitor/App Insights** | 10 000 - 30 000 NOK | Sampling, log retention |
|
||
| **Lisenser (Copilot Studio)** | 200 - 2 000 NOK/bruker/måned | Pilot med få brukere først |
|
||
|
||
**Total estimert TCO (små prosjekter):** 100 000 - 500 000 NOK/år (ekskl. personellkostnader)
|
||
|
||
**Confidence:** Lav-Moderat (estimater er generelle, varierer betydelig per use case)
|
||
|
||
---
|
||
|
||
## Kostnad og lisensiering
|
||
|
||
### Lisensmodeller for Microsoft AI
|
||
|
||
| Produkt | Lisensmodell | AI-kostnad inkludert? | Ekstra kostnad |
|
||
|---------|--------------|------------------------|----------------|
|
||
| **Azure OpenAI** | Pay-per-token eller PTU | Nei | Basert på bruk eller PTU-reservasjon |
|
||
| **Copilot Studio** | Per bruker/måned (~$200/måned) | Ja (inferens inkludert) | Økt bruk kan koste ekstra |
|
||
| **Power Platform (premium)** | Per bruker/måned (~$40/bruker) | Delvis (500 AI Builder credits/bruker) | Ytterligere credits må kjøpes |
|
||
| **M365 Copilot** | Per bruker/måned (~$360/bruker) | Ja (inferens inkludert) | Ingen ekstra kostnad |
|
||
|
||
**Viktig:** Priser er illustrative per januar 2026. Verifiser på [Microsoft lisensside](https://www.microsoft.com/licensing/).
|
||
|
||
**Confidence:** Moderat (lisenser endres regelmessig)
|
||
|
||
### Cost avoidance-strategier
|
||
|
||
| Strategi | Potensial besparelse | Kompleksitet |
|
||
|----------|----------------------|--------------|
|
||
| **Bytt fra GPT-4.1 til GPT-4.1-mini** | 50% | Lav (krever testing) |
|
||
| **Bruk Model Router** | 30-60% | Middels (Microsoft Foundry-setup) |
|
||
| **Prompt-optimalisering** | 20-40% | Lav (kan gjøres iterativt) |
|
||
| **Fine-tuning for å erstatte større modell** | 40-70% | Høy (krever treningsdata og vedlikehold) |
|
||
| **Migrering til PTU (ved høyt volum)** | 20-50% | Middels (krever volumprediksjon) |
|
||
| **Caching (for repeterende prompts)** | 10-30% | Lav-Middels (krever cache-logikk) |
|
||
|
||
**Confidence:** Moderat (besparelsespotensial varierer per use case)
|
||
|
||
### Regional prisvariasjoner
|
||
|
||
**Eksempel (verifiser på Azure-prisside):**
|
||
- Norway East: Standard pricing
|
||
- West Europe: Standard pricing
|
||
- East US: ~5-10% billigere (ikke-europeisk region)
|
||
|
||
**Anbefaling for norske virksomheter:**
|
||
- Bruk Norway East for compliance-sensitive data
|
||
- Vurder West Europe for ikke-sensitive workloads (latens vs. kostnad)
|
||
|
||
**Confidence:** Moderat (prisvariasjon finnes, men er ofte marginal)
|
||
|
||
---
|
||
|
||
## For arkitekten (Cosmo)
|
||
|
||
### Når bruke denne referansen
|
||
|
||
**Triggers:**
|
||
- Bruker spør: "Hvilken modell bør jeg bruke for [use case]?"
|
||
- Bruker ønsker kostnadsoptimalisering av eksisterende løsning
|
||
- Bruker planlegger høyvolum-deployment og er bekymret for kostnad
|
||
- Bruker vil sammenligne GPT-4o-mini vs. GPT-4.1 vs. GPT-5
|
||
|
||
### Rådgivningsprosess
|
||
|
||
**1. Forstå use case:**
|
||
- Hva skal modellen gjøre? (klassifisering, generering, resonnering)
|
||
- Hva er volumet? (forespørsler/dag, tokens per forespørsel)
|
||
- Hva er latenskrav? (sanntid vs. batch)
|
||
|
||
**2. Foreslå modellstrategi:**
|
||
- Bruk beslutningstreet i "Beslutningsveiledning"
|
||
- Anbefal tiered approach hvis varierende kompleksitet
|
||
- Vurder Model Router for dynamisk ruting
|
||
|
||
**3. Estimer kostnader:**
|
||
- Bruk ROI-kalkulatoren (konseptuell seksjon)
|
||
- Sammenlign nåværende vs. foreslått modell
|
||
- Inkluder TCO (ikke bare inferenskostnad)
|
||
|
||
**4. Anbefal testing:**
|
||
- "Start med GPT-4.1-mini, evaluer kvalitet"
|
||
- "Opprett evaluation dataset for sammenligning"
|
||
- "Test i 1-2 uker før full rollout"
|
||
|
||
**5. Oppfølging:**
|
||
- Sett opp Cost Management alerts
|
||
- Følg opp med Azure Monitor for ytelsesmetrikker
|
||
- Juster modellvalg basert på faktisk bruk
|
||
|
||
### Typiske spørsmål og svar
|
||
|
||
**Q: "Skal jeg alltid bruke billigste modell?"**
|
||
**A:** Nei. Velg den minste modellen som oppfyller kvalitetskravene. Hvis GPT-4.1-nano gir 70% kvalitet men GPT-4.1-mini gir 95%, kan ekstra kostnad være verdt det.
|
||
|
||
**Q: "Hvordan vet jeg om GPT-4.1-mini er god nok vs. GPT-4.1?"**
|
||
**A:** Opprett et evaluation dataset (50-100 representative eksempler), kjør begge modeller, sammenlign output. Bruk Microsoft Foundry evaluations for strukturert testing.
|
||
|
||
**Q: "Er fine-tuning alltid billigere?"**
|
||
**A:** Nei. Fine-tuning har opfront-kostnad (training) og hosting-kostnad ($1.70/time). Kun kostnadseffektivt ved høyt volum (>100K forespørsler/måned) eller hvis du kan erstatte GPT-4.1 med fine-tuned GPT-4.1-mini.
|
||
|
||
**Q: "Hvordan optimalisere kostnader for RAG-løsning?"**
|
||
**A:**
|
||
1. Bruk semantic search for å redusere kontekst-tokens
|
||
2. Velg GPT-4.1-mini for spørsmål med god retrieval
|
||
3. Fallback til GPT-4.1 hvis ikke confident svar
|
||
4. Optimaliser chunking-strategi i Azure AI Search
|
||
|
||
### Confidence markers i rådgivning
|
||
|
||
Bruk alltid confidence markers når du anbefaler modeller:
|
||
|
||
- **Høy confidence:** "GPT-4.1-mini er dokumentert 50% billigere enn GPT-4.1 for samme deployment-type."
|
||
- **Moderat confidence:** "Basert på lignende use cases, forventer jeg 30-50% kostnadsreduksjon."
|
||
- **Lav confidence:** "Uten å teste på ditt spesifikke dataset, er det vanskelig å si om GPT-4.1-nano vil være tilstrekkelig."
|
||
|
||
### Verktøy for kostnadsestimering
|
||
|
||
**Anbefal alltid:**
|
||
1. [Azure Pricing Calculator](https://azure.microsoft.com/pricing/calculator/) for estimering
|
||
2. [Microsoft Foundry Calculator](https://ai.azure.com/resource/calculator) for PTU-estimering
|
||
3. Azure Cost Management for faktisk kostnadssporing
|
||
|
||
### Vanlige fallgruver
|
||
|
||
| Fallgruve | Konsekvens | Hvordan unngå |
|
||
|-----------|------------|---------------|
|
||
| **Alltid bruke GPT-5** | 3-5x høyere kostnad | Vurder GPT-4.1-mini eller GPT-4.1 først |
|
||
| **Glemme hosting-kostnad for fine-tuning** | $1.70/time × 24 × 30 = $1 224/måned | Slett ubrukte fine-tuned deployments |
|
||
| **Ikke sette max_tokens** | Unødvendig lange svar = høyere output-kostnad | Sett `max_tokens` eksplisitt |
|
||
| **Bruke Standard over Global Standard uten grunn** | 10-20% høyere kostnad | Velg Global Standard hvis data residency ikke kreves |
|
||
| **Ikke monitere kostnader** | Uventede regninger | Sett opp Cost Management alerts |
|
||
|
||
---
|
||
|
||
## Kilder og verifisering
|
||
|
||
### Primærkilder (Microsoft Learn)
|
||
|
||
1. **GPT-5 vs GPT-4.1: choosing the right model for your use case**
|
||
URL: https://learn.microsoft.com/en-us/azure/foundry/foundry-models/how-to/model-choice-guide?view=foundry-classic
|
||
Hentet: 2026-02
|
||
Innhold: Modellsammenligninger, latency trade-offs, reasoning-nivåer
|
||
|
||
2. **Plan to manage costs for Azure OpenAI in Foundry Models**
|
||
URL: https://learn.microsoft.com/en-us/azure/foundry/concepts/manage-costs
|
||
Hentet: 2026-02
|
||
Innhold: Billing models, token pricing, cost monitoring
|
||
|
||
3. **Cost management for fine-tuning**
|
||
URL: https://learn.microsoft.com/en-us/azure/foundry/openai/how-to/fine-tuning-cost-management?view=foundry-classic
|
||
Hentet: 2026-02
|
||
Innhold: Training costs, hosting costs, deployment types
|
||
|
||
4. **Optimize model cost and performance**
|
||
URL: https://learn.microsoft.com/en-us/azure/foundry/control-plane/how-to-optimize-cost-performance?view=foundry
|
||
Hentet: 2026-02
|
||
Innhold: Model Router, cost optimization workflows
|
||
|
||
5. **Azure OpenAI in Foundry Models**
|
||
URL: https://learn.microsoft.com/en-us/azure/foundry/foundry-models/concepts/models-sold-directly-by-azure
|
||
Hentet: 2026-02
|
||
Innhold: Model catalog, capabilities, regional availability
|
||
|
||
6. **Understanding costs associated with provisioned throughput units (PTU)**
|
||
URL: https://learn.microsoft.com/en-us/azure/foundry/openai/concepts/provisioned-throughput-billing
|
||
Hentet: 2026-02
|
||
Innhold: PTU pricing, throughput per PTU, when to use PTU
|
||
|
||
### Sekundærkilder
|
||
|
||
7. **Azure OpenAI Pricing Page**
|
||
URL: https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/
|
||
Note: Offisiell prisside (sjekk for oppdaterte priser)
|
||
|
||
8. **Azure Pricing Calculator**
|
||
URL: https://azure.microsoft.com/pricing/calculator/
|
||
Note: For pre-deployment estimering
|
||
|
||
9. **Microsoft Foundry Calculator**
|
||
URL: https://ai.azure.com/resource/calculator
|
||
Note: For PTU-estimering
|
||
|
||
### Verifiseringsstatus
|
||
|
||
| Påstand | Kilde | Confidence |
|
||
|---------|-------|------------|
|
||
| GPT-4.1-mini er 50% billigere enn GPT-4.1 | Source 2, illustrative pricing examples | Høy |
|
||
| Model Router kan spare opptil 60% | Source 4 | Høy |
|
||
| Fine-tuning hosting cost er $1.70/time | Source 3 | Høy |
|
||
| GPT-5 har fire reasoning-nivåer | Source 1 | Høy |
|
||
| PTU gir 3 000 input TPM per PTU for GPT-4.1 | Source 6 | Høy |
|
||
|
||
**Totalt antall kilder:** 9 (6 primære Microsoft Learn-artikler, 3 pricing-referanser)
|
||
**MCP-kall brukt:** 6 (4x docs_search, 2x docs_fetch)
|
||
|
||
### Siste oppdatering og gyldighet
|
||
|
||
**Dokumentasjonsdato:** Januar-februar 2026; modell-enumerasjon oppdatert 2026-06
|
||
**Priser gyldige per:** Februar 2026 (illustrative — verifiser alltid på offisiell prisside)
|
||
**Modeller i GA (per 2026-06):** GPT-4.1-serien, GPT-4o/GPT-4o-mini, o-serien (o1/o3/o3-mini/o4-mini), og GPT-5-generasjonen: GPT-5/-mini/-nano (2025-08), GPT-5.1 (2025-11-13), GPT-5.2 (2025-12-11), GPT-5.3-codex/-chat (2026-02/03), GPT-5.4 + GPT-5.4-pro (2026-03-05), GPT-5.5 (2026-04-24), gpt-chat-latest (2026-05, preview). Snapshotten over (GPT-5 / GPT-4.1 / GPT-4o-mini) er én generasjon bak — GPT-5.1→5.5 finnes nå. Full, region-verifisert modellkatalog: `model-catalog-2026.md`.
|
||
**Neste review anbefalt:** Q4 2026 (Microsoft oppdaterer priser kvartalsvis)
|
||
|
||
---
|
||
|
||
**Dokumenteier:** Cosmo Skyberg, Microsoft AI Solution Architect
|
||
**Godkjent for:** Offentlig sektor Norge, Enterprise Azure-kunder
|
||
**Versjon:** 1.0
|