ms-ai-architect/skills/ms-ai-security/references/cost-optimization/gpt5-gpt41-pricing-models.md
Kjell Tore Guttormsen ddce43d8b2 feat(ms-ai-architect): Spor 1 — Port-1-substrat migrert på 4 ikke-advisor-skills (243 Source + 327 Type + 325 TOC + stale-verified poison fjernet) [skip-docs]
Steg 9 (R4): unified migrate-corpus.mjs --write over engineering/governance/
infrastructure/security. 327 filer mutert, verified=null, prosa byte-identisk
(fra første ## seksjon), advisor urørt (0 endringer).

To applier-fixes oppdaget under kjøring (TDD, RED→GREEN):
- insertHeaderFields: anker faller nå tilbake når en meta-linje selv passerer
  500B (2 filer pakket et avsnitt i **Status:** → Type/Source landet utenfor
  scan-vinduet, applierens post-write-assertion fanget + restaurerte).
- normalizeStaleVerified: fjerner nå ALLE stale non-date **Verified:** i
  500B-vinduet, inkl. stray body-dup rett under --- (9 mlops-genaiops-filer var
  ellers falskt "verified"/fresh, droppet fra worklist). Operatør-godkjent
  utvidelse av carve-out; kun stray metadata-linjer, aldri prosa.

test-transform-criterion: precondition oppdatert til post-migrasjons-sannhet
(fila bærer nå Source). Suite 728/728 grønn.
2026-07-04 10:19:11 +02:00

636 lines
34 KiB
Markdown
Raw Blame History

This file contains invisible Unicode characters

This file contains invisible Unicode characters that are indistinguishable to humans but may be processed differently by a computer. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# GPT-5 og GPT-4.1: Prismodeller og kostnadsoptimalisering
**Last updated:** 2026-06 | Priser verifisert: WebSearch + OpenAI/Azure pricing juni 2026
**Status:** GA (GPT-4.1-serien), GA (GPT-5-serien — `gpt-5` og `gpt-5-codex` har registreringskrav). GPT-5.2 reasoning og GPT-5.3 chat lagt til i Copilot Studio-prompt-builder
**Category:** Cost Optimization & FinOps for AI
**Type:** reference
**Source:** https://learn.microsoft.com/azure/foundry/concepts/manage-costs
**Prissannhet:** Rå token-priser eies av `deterministic-cost-calculation-model.md` §1.1 (kanonisk register). Denne fila gir kontekst, scenarioer og rådgivning — ved tallkonflikt vinner registeret.
---
## Innhold
- [Introduksjon](#introduksjon)
- [Kjernekomponenter](#kjernekomponenter)
- [Beslutningsveiledning](#beslutningsveiledning)
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
- [Kilder og verifisering](#kilder-og-verifisering)
## Introduksjon
GPT-5- og GPT-4.1-seriene er de to nyeste flaggskipmodellene fra OpenAI tilgjengelig i Microsoft Foundry. De representerer to distinkte designfilosofier: GPT-5 optimalisert for dyp resonnering og komplekse oppgaver, GPT-4.1 optimalisert for hastighet, gjennomstrømming og kostnadseffektivitet.
**Confidence:** Høy (GPT-4.1- og GPT-5-priser verifisert juni 2026 via WebSearch + OpenAI/Azure pricing)
Denne referansen dekker:
- Bekreftet prising per 1M tokens (USD og NOK)
- Deployment-typer og deres kostnadsimplikasjon
- Sammenligningstabeller (GPT-4o vs. GPT-4.1 vs. GPT-5)
- Copilot Credits-klassifisering per modell
- Optimaliserings­strategier og beslutningsveiledning
**Viktig merknad om priser:** Azure prisside (azure.microsoft.com/pricing) benytter JavaScript-rendering og returnerer tomme verdier ved programmatisk henting. Priser her er hentet fra Microsoft Learn-dokumentasjon, Content Understanding-eksempler og WebSearch mot OpenAI/Azure pricing (juni 2026). GPT-5-flagshipprisen ($1.25/$10.00) er nå publisert og verifisert — det tidligere estimat-båndet ($1015/$4060) var 812x for høyt og er fjernet.
---
## Kjernekomponenter
### 1. GPT-4.1-serien — Bekreftet prising
**Kilde:** Azure Content Understanding-dokumentasjon, Microsoft Foundry provisioned throughput-dokumentasjon (bekreftet 1:4 input/output-ratio)
| Modell | Input (per 1M tokens) | Output (per 1M tokens) | Cached Input | Kontekst |
|--------|-----------------------|------------------------|--------------|----------|
| `gpt-4.1` (Global) | **$2.00** | **$8.00** | ~$0.50 | 1M tokens (128K ved provisioned) |
| `gpt-4.1-mini` (Global) | **$0.40** | **$1.60** | ~$0.10 | 1M tokens (128K ved provisioned) |
| `gpt-4.1-nano` (Global) | **$0.10** | **$0.40** | ~$0.025 | 1M tokens (128K ved provisioned) |
**Confidence:** Høy for gpt-4.1 og gpt-4.1-mini (bekreftet via Content Understanding priseksempler og PTU-dokumentasjon). Moderat for gpt-4.1-nano (interpolert fra dokumenterte ratioer — 1:4 input/output).
**Nøkkelfakta:**
- 1 output token = 4 input tokens i PTU-utnyttelse (matchers prisratio)
- Kontekstvindu: 1 047 576 tokens (full), 128 000 tokens (standard og provisioned deployments), 300 000 tokens (batch deployments)
- Treningsdata: til og med mai 2024
- Versjon: `2025-04-14`
- Batch API: 50% rabatt på Global Standard-priser
**Tilgjengelige deployment-typer for GPT-4.1-serien:**
- Global Standard, Data Zone Standard, Regional (Standard og Provisioned)
- Priority Processing: tilgjengelig for gpt-4.1 (ikke mini/nano)
---
### 2. GPT-5-serien — Bekreftet prising
**Verifisert juni 2026** (WebSearch mot OpenAI API pricing + Azure OpenAI pricing). Flagship-tallet $1.25/$10.00 er bekreftet av to uavhengige kilder. PTU-ratioen (1 output ≈ 8 input) er konsistent med prisforholdet ($10.00 / $1.25 = 8).
| Modell | Input (per 1M tokens) | Output (per 1M tokens) | Confidence | Merknader |
|--------|-----------------------|------------------------|------------|-----------|
| `gpt-5` (Global) | **$1.25** | **$10.00** | Høy | Cached input $0.125. Registreringskrav |
| `gpt-5-mini` (Global) | **$0.25** | **$2.00** | Moderat | OpenAI listepris (lansering); aggregatorer rapporterer redusert $0.125/$1.00 (2026) — verifiser |
| `gpt-5-nano` (Global) | **$0.05** | **$0.40** | Høy | Billigste GPT-5-nivå |
| `gpt-5-chat` (Global) | ~$1.25 | ~$10.00 | Moderat | Preview (non-reasoning). Følger gpt-5-flagship-rate. Standard rate i Copilot Credits — verifiser |
> **Nyere generasjoner (verifisert juni 2026, håndteres i modellkatalogen):** gpt-5.2 $1.75/$14 · gpt-5.4 $2.50/$15 (mini $0.75/$4.50, nano $0.20/$1.25) · gpt-5.5 $5.00/$30 (cached $0.50). Se `platforms/model-catalog-2026.md`. OpenAIs prisside viser nå 5.4/5.5 som gjeldende flagship-generasjon; `gpt-5` (1.x-generasjonen) er fortsatt tilgjengelig i Azure med prisene over.
**OBLIGATORISK:** Token-priser endres. Kryssjekk det kanoniske registeret (`deterministic-cost-calculation-model.md` §1.1) og [Azure OpenAI prisside](https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/) før budsjettering.
**Tilgjengelighetsbegrensning:**
- `gpt-5` og `gpt-5-codex`: Krever registrering og godkjenning (begrenset tilgang)
- `gpt-5-mini`, `gpt-5-nano`, `gpt-5-chat`: Ingen registreringskrav
- Kontekstvindu: 400 000 tokens (272K input / 128K output for resonneringsmodeller)
---
### 3. Referanse: GPT-4o (sammenligning)
**Kilde:** Allment tilgjengelig fra Azure-dokumentasjon
| Modell | Input (per 1M tokens) | Output (per 1M tokens) | Kontekst |
|--------|-----------------------|------------------------|----------|
| `gpt-4o` (Global) | ~$2.50 | ~$10.00 | 128K |
| `gpt-4o-mini` (Global) | ~$0.15 | ~$0.60 | 128K |
**Confidence:** Høy (bredt dokumentert)
---
### 4. Deployment-typer og kostnadsimplikasjon
| Deployment-type | Prismodell | Datalagring | Best for | Prediktabilitet |
|-----------------|------------|-------------|----------|-----------------|
| **Global Standard** | Pay-per-token | Ingen garanti (trafikk rutes globalt) | Høyt volum, lavest pris, ikke-sensitive data | Lav (avhenger av bruk) |
| **Data Zone Standard** | Pay-per-token (~510% høyere enn Global) | EU- eller US-region garantert | Norske virksomheter med GDPR-krav, ikke-sensitiv produksjon | Lav (avhenger av bruk) |
| **Regional Standard** | Pay-per-token (~1020% høyere enn Global) | Spesifikk region (f.eks. Norway East) | Personopplysninger, kritisk compliance | Lav (avhenger av bruk) |
| **Provisioned Throughput (PTU)** | Fast timepris per PTU | Velges ved deployment | Forutsigbart høyvolum, latens-SLA | Høy (fast kostnad uavhengig av bruk) |
| **Batch API** | 50% rabatt på Global Standard | Global | Ikke-sanntidsoppgaver (24t behandlingstid) | Moderat (avhenger av bruk) |
**PTU-gjennomstrømming per modell (bekreftet, offisiell dokumentasjon):**
| Modell | Input TPM per PTU | Latens-SLA (p50) | Min PTU (Global) | Min PTU (Regional) |
|--------|-------------------|------------------|-----------------|-------------------|
| `gpt-5` | 4 750 | 99% > 50 TPS | 15 | 50 |
| `gpt-5-mini` | 23 750 | 99% > 80 TPS | 15 | 25 |
| `gpt-4.1` | 3 000 | 99% > 80 TPS | 15 | 50 |
| `gpt-4.1-mini` | 14 900 | 99% > 90 TPS | 15 | 25 |
| `gpt-4.1-nano` | 59 400 | 99% > 100 TPS | 15 | 25 |
| `o4-mini` | 5 400 | 99% > 90 TPS | 15 | 25 |
**Confidence:** Høy (direkte fra offisiell PTU-dokumentasjon)
---
### 5. Sammenligningstabeller
#### 5a. Pris- og kapabilitetssammenligning
| Modell | Input (per 1M) | Output (per 1M) | Konfidensgrad | Kontekst | Resonneringsevne | Latens |
|--------|---------------|-----------------|---------------|----------|-----------------|--------|
| `gpt-4o-mini` | ~$0.15 | ~$0.60 | Høy | 128K | Lav | Lavest |
| `gpt-4.1-nano` | ~$0.10 | ~$0.40 | Moderat | 1M (128K PTU) | Lav | Lavest |
| `gpt-4.1-mini` | $0.40 | $1.60 | Høy | 1M (128K PTU) | LavModerat | Lav |
| `gpt-4o` | ~$2.50 | ~$10.00 | Høy | 128K | Moderat | Moderat |
| `gpt-4.1` | $2.00 | $8.00 | Høy | 1M (128K PTU) | Moderat | LavModerat |
| `gpt-5-nano` | $0.05 | $0.40 | Høy | 400K | Moderat (resonnering) | Lav |
| `gpt-5-mini` | $0.25 | $2.00 | Moderat | 400K | Høy (resonnering) | Moderat |
| `gpt-5` | $1.25 | $10.00 | Høy | 400K | Svært høy (resonnering) | Høy |
#### 5b. Relativ kostnad per 1 000 forespørsler (200 input + 100 output tokens)
| Modell | Kostnad (USD) | Kostnad (NOK, ~10.5 kurs) | Relativt vs. GPT-4.1 |
|--------|--------------|--------------------------|----------------------|
| `gpt-4.1-nano` | $0.06 | ~0.63 NOK | 95% billigere |
| `gpt-4.1-mini` | $0.24 | ~2.52 NOK | 80% billigere |
| `gpt-5-mini` | $0.25 | ~2.63 NOK | 79% billigere |
| `gpt-4.1` | $1.20 | ~12.60 NOK | Referanse |
| `gpt-5` | $1.25 | ~13.13 NOK | ~4% dyrere (≈ paritet med gpt-4.1) |
**Confidence:** Høy (alle priser verifisert juni 2026). Merk: for denne output-tunge miksen er `gpt-5``gpt-4.1` i kost — gpt-5 har billigere input ($1.25 vs $2.00) men dyrere output ($10.00 vs $8.00). Kostnadsdriveren for gpt-5 er resonnerings-tokens (faktureres som output), ikke base-raten.
---
### 6. NOK-kostnadsestimater
**Valutakurs brukt:** 1 USD = 10.5 NOK (veiledende, verifiser aktuell kurs)
#### Månedlig kostnadsestimat for typiske workloads
**Scenario A: Kundestøtte chatbot (100 000 forespørsler/mnd, 150 input + 100 output tokens)**
| Modell | USD/mnd | NOK/mnd | Anbefaling |
|--------|---------|---------|------------|
| `gpt-4.1-nano` | ~$5.50 | ~58 NOK | Enkel FAQ, høyt volum |
| `gpt-4.1-mini` | ~$22 | ~231 NOK | Standard chatbot |
| `gpt-5-mini` | ~$24 | ~249 NOK | Resonnering ved moderat volum |
| `gpt-4.1` | ~$110 | ~1 155 NOK | Kompleks kundesupport |
| `gpt-5` | ~$119 | ~1 247 NOK | Dyp resonnering; ≈ gpt-4.1-kost |
**Scenario B: Dokumentanalysepipeline (10 000 dokumenter/mnd, 2 000 input + 500 output tokens)**
| Modell | USD/mnd | NOK/mnd | Anbefaling |
|--------|---------|---------|------------|
| `gpt-5-mini` | ~$15 | ~158 NOK | Resonnering, ≈ gpt-4.1-mini-kost |
| `gpt-4.1-mini` | ~$16 | ~168 NOK | Standardanalyse |
| `gpt-5` | ~$75 | ~788 NOK | Dyp resonnering — billigere input enn gpt-4.1 |
| `gpt-4.1` | ~$80 | ~840 NOK | Juridisk/finansiell analyse |
**Merk:** Ved denne input-tunge miksen (4:1 input/output) er `gpt-5` (~$75) faktisk litt billigere enn `gpt-4.1` (~$80) — gpt-5 input ($1.25) er rimeligere enn gpt-4.1 ($2.00). Den gamle påstanden «gpt-5 koster ~$2 7504 100/mnd» var basert på det feilaktige estimat-båndet ($1015/$4060) og er fjernet.
**Scenario C: Batch-prosessering (50% rabatt, 500 000 forespørsler/mnd, 200 input + 50 output tokens)**
| Modell | USD/mnd (batch) | NOK/mnd | Merknad |
|--------|----------------|---------|---------|
| `gpt-5-nano` | ~$7.50 | ~79 NOK | Billigste resonnering, klassifisering |
| `gpt-4.1-nano` | ~$10 | ~105 NOK | Klassifisering, tagging |
| `gpt-4.1-mini` | ~$40 | ~420 NOK | Sammendrag, analyse |
| `gpt-4.1` | ~$200 | ~2 100 NOK | Kompleks batch |
**Confidence:** Høy (alle priser verifisert juni 2026; NOK ved kurs 10.5 — varierer med valutakurs). Alle tall er reproduserbare: USD/mnd = (input_tokens/1M × input_pris) + (output_tokens/1M × output_pris), × 0.5 ved batch.
---
### 7. Copilot Credits-klassifisering
Modeller i Copilot Studio og AI Builder (Power Platform) prises etter tre takstnivåer. Dette er direkte relevant for norske offentlige virksomheter som bruker Power Platform.
| Modell | Takst-nivå | Copilot Credits | Power Platform Credits |
|--------|-----------|----------------|----------------------|
| `gpt-4.1-mini` | **Basic** | Laveste forbruk | Laveste forbruk |
| `gpt-4.1` | **Standard** | Moderat forbruk | Moderat forbruk |
| `gpt-5-chat` (preview) | **Standard** | Moderat forbruk | Moderat forbruk |
| `gpt-5-reasoning` (preview) | **Premium** | Høyeste forbruk | Høyeste forbruk |
| `o3` | **Premium** | Høyeste forbruk | Høyeste forbruk |
| `Claude Sonnet 4.5` (experimental) | **Standard** | Moderat forbruk | Moderat forbruk |
| `Claude Opus 4.5` (experimental) | **Premium** | Høyeste forbruk | Høyeste forbruk |
*(Verified MCP 2026-04)*
**Viktige implikasjoner:**
- **GPT-4.1 mini er nå standardmodellen i Copilot Studio** (erstattet GPT-4o mini). GPT-4o og GPT-4o mini er kun tilgjengelig i US government-regioner.
- Copilot Studio inkluderer et månedlig kvantum av Copilot Credits. Å bruke gpt-5-reasoning eller o3 tapper disse vesentlig raskere enn gpt-4.1-mini.
- Standard-rate (gpt-4.1 og gpt-5-chat) er tilgjengelig uten ekstra tilleggslisens i de fleste planer.
- Premium-rate (gpt-5-reasoning, o3, Claude Opus 4.5) kan kreve pay-as-you-go-overskudd ved høyt volum.
- **Claude Sonnet 4.5 og Opus 4.5** er nå tilgjengelig i Copilot Studio (experimental, 200K kontekstvindu).
- **M365 Copilot (enterprise):** Inkluderer standardtilgang til GPT-5 (inkl. standard Copilot Chat). Priority Access krever M365 Copilot-lisens.
**Confidence:** Høy (basert på offisiell AI Builder/Copilot Studio-dokumentasjon, 2026-04)
---
### 8. GPT-5 Reasoning-nivåer og kostnad
GPT-5 introducerer fire justerbare tenkningsnivåer. Kostnad og latens skalerer med tenkningsdybde.
| Resonneringsnivå | Beskrivelse | Latens | Relativ kostnad | Bruksområde |
|-----------------|-------------|--------|-----------------|-------------|
| **Minimal** | Svært få interne resonneringstokens | Raskest | Lavest | Bulk-operasjoner, enkle transformasjoner |
| **Low** | Let resonnering, rask vurdering | Rask | Lav | Triage, korte svar, enkle redigeringer |
| **Medium (default)** | Balansert dybde vs. hastighet | Moderat | Middels | Innholdsdrafting, moderat koding, RAG Q&A |
| **High** | Dyp, flertrinns "think-through" | Tregest | Høyest | Kompleks planlegging, analyse, multi-hop reasoning |
**Viktig:** Samme resonneringsnivå-logikk gjelder for `gpt-5`, `gpt-5-mini` og `gpt-5-nano`. Absolutt kostnad og latens skalerer ned med mini og nano, men avveiningene er identiske.
**Parallelle verktøykall:** Støttes IKKE ved `Minimal` reasoning_effort. Bruk Low/Medium/High for agentbruk.
**Confidence:** Høy (direkte fra offisiell GPT-5 model choice guide, februar 2026)
---
### 9. Optimaliserings­strategier
#### Strategi 1: Modelltiering (Small → Medium → Large)
```
Trigger: Klassifiser forespørselskompleksitet FØR valg av modell
Tier 1 — Nano (enkle oppgaver):
- Klassifisering, tagging, enkle strukturerte outputs
- Modell: gpt-4.1-nano
- Estimert kostnad: ~$0.100.40/1M tokens
Tier 2 — Mini (standard oppgaver):
- Chatbots, drafting, RAG Q&A, oppsummering
- Modell: gpt-4.1-mini
- Estimert kostnad: ~$0.401.60/1M tokens
Tier 3 — Full (komplekse oppgaver):
- Juridisk analyse, flertrinns planlegging, agenter
- Modell: gpt-4.1 eller gpt-5-mini
- Estimert kostnad: $28/1M tokens (gpt-4.1)
```
**Besparelsespotensial:** 6080% vs. alltid bruke gpt-4.1
#### Strategi 2: Model Router (Microsoft Foundry)
Microsoft Foundry Model Router analyserer prompt-kompleksitet og velger automatisk den mest kostnadseffektive modellen.
- **Potensiell besparelse:** Opptil 60% vs. å alltid bruke GPT-5-familien (dokumentert av Microsoft)
- **Implementering:** Deploy Model Router i Microsoft Foundry, konfigurer underliggende modeller
- **Ingen kodeendringer:** Transparente for applikasjonen
**Confidence:** Høy (Model Router er GA-funksjonalitet, besparelsestallet er dokumentert av Microsoft)
#### Strategi 3: Batch API (50% rabatt)
For ikke-sanntidsoppgaver med 24-timers SLA:
- Nattlig rapportgenerering og sammendrag
- Innholdsmoderering
- Masseopplastings-analyse
- E-postklassifisering
**Besparelsespotensial:** Fast 50% rabatt på Global Standard-pris
#### Strategi 4: Prompt Caching (Cached Input)
Gjenbruk av identisk kontekst (system prompt, dokumenter) aktiverer cached input-prising:
- gpt-4.1: cached input ~$0.50/1M (75% rabatt vs. full input)
- Spesielt effektivt for RAG-løsninger med fast system prompt
- Krever identisk prefiks (prompt caching aktiveres automatisk for repeterende kontekst)
**Confidence:** Moderat (caching-ratio er estimert, ikke bekreftet for alle modeller per februar 2026)
#### Strategi 5: PTU ved forutsigbart høyt volum
**Bruk PTU når:**
- Volum er forutsigbart (>70% utnyttelse)
- Latens-SLA er kritisk
- Månedlig token-volum er høyt nok til at fast PTU-kostnad er lavere enn pay-per-token
**PTU break-even (illustrativt for gpt-4.1):**
```
Pay-per-token: 3 000 000 tokens/mnd × $2.00/1M = $6/mnd per ~1M monthly tokens
PTU: 1 PTU = 3 000 input TPM = ~130M tokens/mnd kapasitet
Break-even: Når pay-per-token overstiger PTU-timeprisen × 730 timer/mnd
```
Bruk [Microsoft Foundry PTU-kalkulator](https://ai.azure.com/resource/calculator) for presis beregning.
**Confidence:** Høy (PTU TPM-verdier er offisielt dokumentert. Break-even avhenger av PTU-timepris som ikke er publisert)
#### Strategi 6: Reasoning-nivå-optimalisering (GPT-5)
```python
def select_reasoning_effort(task_type: str) -> str:
if task_type in ["classification", "summarization", "simple_qa"]:
return "low" # 4060% billigere enn high
elif task_type in ["content_drafting", "rag_qa", "moderate_coding"]:
return "medium" # Standard valg
elif task_type in ["legal_analysis", "complex_planning", "multihop_reasoning"]:
return "high" # Maks nøyaktighet
else:
return "medium" # Sikker default
```
**Besparelsespotensial:** 4060% kostnadsreduksjon vs. alltid bruke `high` reasoning
---
## Beslutningsveiledning
### Beslutningstre: GPT-4.1 vs. GPT-5
```
START
|
V
Krever oppgaven dyp, flertrinns resonnering?
├─ JA → Er resonnering viktigere enn kostnad/latens?
│ ├─ JA → GPT-5 (juster reasoning_effort)
│ └─ NEI → GPT-4.1 (raskere, billigere, tilstrekkelig for de fleste)
└─ NEI → Er oppgaven voluminøs og/eller latens-sensitiv?
├─ JA → GPT-4.1-mini eller GPT-4.1-nano
└─ NEI → GPT-4.1-mini (balanse mellom kostnad og kvalitet)
```
### Scenario-basert anbefaling
| Scenario | Anbefalt modell | Kostnadsnivå (NOK/mnd, 100K forespørsler) |
|----------|-----------------|------------------------------------------|
| Enkel FAQ-bot | gpt-4.1-nano | ~58 NOK |
| Kundestøtte chatbot | gpt-4.1-mini + Model Router | ~231 NOK |
| Juridisk dokumentanalyse | gpt-4.1 eller gpt-5 (high) | ~1 1551 250 NOK base (+ resonnerings-tokens ved high) |
| Kode-assistent | gpt-5-mini (medium reasoning) | ~250 NOK base (+ resonnerings-tokens) |
| Nattlig rapport (batch) | gpt-4.1-mini (batch) | ~116 NOK (50% rabatt) |
| Enterprise Copilot (Copilot Studio) | gpt-4.1 (Standard Credits) | Innenfor inkluderte Credits |
| RAG Q&A (norsk offentlig sektor) | gpt-4.1-mini + caching | ~116231 NOK |
**Confidence:** Høy for base-token-kost (priser verifisert juni 2026). Resonnerings-modeller (gpt-5 *-reasoning*) genererer interne resonnerings-tokens som faktureres som output — faktisk kost ved `high` reasoning kan være vesentlig høyere enn base. Mål på reelt forbruk før budsjettering.
### Valg av deployment-type
```
Norsk offentlig sektor:
Personopplysninger (streng Norge-residens) → Regional Standard/PTU (Norway East) + KUN gpt-4o/gpt-4o-mini
Ikke-sensitiv data → Data Zone Standard (EU) for litt lavere kostnad
Høyvolum produksjon → PTU (ved forutsigbart volum)
Utvikling/testing → Global Standard (lavest pris, ingen compliance-garanti)
Batch (ikke-sanntid) → Batch API (50% rabatt på Global)
```
---
## Offentlig sektor (Norge)
### Compliance og dataplassering vs. kostnad
| Deployment-type | Garantert dataplassering | Estimert kostnadsnivå | Anbefaling |
|-----------------|--------------------------|----------------------|------------|
| Norway East Regional | Ja (Norway East) | Høyest (~1020% over Global) | Personopplysninger (GDPR) |
| EU Data Zone | EU-region (ikke spesifikt Norway) | Moderat (~510% over Global) | Ikke-sensitive data, EU GDPR |
| Global Standard | Ingen garanti | Lavest | Kun ikke-sensitiv utvikling/test |
**Anbefaling for offentlig sektor:**
- All behandling av personopplysninger: **Regional Standard — Norway East**
- Ikke-sensitiv AI-bruk i produksjon: **Data Zone Standard (EU)** for moderat kostnadssparing
- Testing og utvikling: **Global Standard**
- Høyvolum stabile workloads: Vurder **PTU i Norway East** for latens-SLA + forutsigbar kostnad
> **Modelltilgjengelighet (viktig — korrigert 2026-06-18):** Tabellen over gjelder deployment-typer generelt. I Norway East er **KUN `gpt-4o`/`gpt-4o-mini`** faktisk tilgjengelig som Norge-resident (Standard/Regional PTU). `gpt-4.1`, o-serien (`o3`/`o4-mini`/`o3-mini`/`o1`) og hele GPT-5-familien finnes **ikke** som Regional/PTU i Norway East — kun Global (data prosesseres globalt). For personopplysninger som krever streng Norge-residens: velg `gpt-4o`/`gpt-4o-mini`. Eneste GPT-5 med EU-residens i Norway East er **gpt-5.5 via Data Zone Standard** (EU-sone, ikke Norge-garantert). Verifisert mot Learn region-tabeller.
### TCO-estimat for offentlig AI-prosjekt med GPT-4.1
| Kostnadselement | Estimat (50K forespørsler/mnd) | Optimalisering |
|-----------------|--------------------------------|----------------|
| gpt-4.1-mini inferens (EU Data Zone / Global) | ~1 3002 600 NOK/mnd | gpt-4.1-mini er IKKE Norge-resident; streng residens → gpt-4o-mini (Regional PTU) |
| gpt-4.1 for komplekse forespørsler (10%) | ~1 200 NOK/mnd | Model Router automatiserer valget |
| Azure AI Search (RAG) | 3 00010 000 NOK/mnd | Optimaliser indeks og chunking |
| Azure Monitor/logging | 1 0003 000 NOK/mnd | Sett sampling-rate |
| **Estimert total** | ~6 00016 000 NOK/mnd | |
**Confidence:** LavModerat (estimater er generelle. Varierer med volum, latens, og faktisk PTU-prising)
---
## Integrasjon med Microsoft-stakken
### Microsoft Foundry: Model Catalog og Router
- Alle GPT-4.1- og GPT-5-modeller tilgjengelig i [Microsoft Foundry](https://ai.azure.com)
- Model Router automatiserer modellvalg — opptil 60% kostnadssparing (dokumentert)
- Foundry PTU-kalkulator: [ai.azure.com/resource/calculator](https://ai.azure.com/resource/calculator)
### Copilot Studio
- Default modell: **gpt-4.1-mini** (Basic rate — laveste Copilot Credits-forbruk)
- Brukeren kan manuelt velge gpt-4.1 (Standard) eller gpt-5-reasoning (Premium) per prompt
- Copilot Credits-kvantum inkludert i lisenspakke; overskudd faktureres via pay-as-you-go
**Utvidet modell-lineup i Copilot Studio prompt-builder (Verified MCP 2026-05):**
| Modell | Rate | Kontekst | Kategori | Kommentar |
|--------|------|----------|----------|-----------|
| `gpt-4.1-mini` (default) | Basic | 128K | Mini | Trent t.o.m. juni 2024 |
| `gpt-4.1` | Standard | 128K | General | Trent t.o.m. juni 2024 |
| `gpt-5-chat` | Standard | 128K | General | Trent t.o.m. sept 2024 |
| `gpt-5-reasoning` | Premium | 400K | Deep | Trent t.o.m. sept 2024 |
| `gpt-5.2-reasoning` | Premium | 400K | Deep | Trent t.o.m. okt 2024 |
| `gpt-5.3-chat` | Standard | 128K | General | Managed model |
| `Claude Sonnet 4.6` | Standard | 200K | General | Eksternt fra Anthropic — egne data-handling-vilkår |
| `Claude Opus 4.6` | Premium | 200K | Deep | Eksternt fra Anthropic |
| `Grok 4.1 Fast` (Non-reasoning) | Standard | — | General | **Eksperimentell/ikke anbefalt for produksjon.** Microsoft har funnet lavere safety/jailbreak-scores; kan generere eksplisitt innhold |
GPT-4o mini og GPT-4o brukes fortsatt i US Government regions (offer comparable funksjonalitet til GPT-4.1 mini/GPT-4.1).
### AI Builder (Power Platform)
- Default modell: **gpt-4.1-mini** (Basic rate prompt builder credits)
- Modeller tilgjengelig: gpt-4.1-mini (Basic), gpt-4.1 (Standard), gpt-5-chat (Standard), gpt-5-reasoning (Premium), gpt-5.2-variants (experimental)
- Prompt builder credits forbrukes per kall; inkludert i premium Power Platform-planer (500 credits/bruker/mnd)
### Azure Cost Management
- Grupper kostnader etter `Meter` for per-modell kostnadssporing
- Sett budsjetter med alerts ved 50%, 75%, 90%
- Tag-strategi: `model`, `deployment-type`, `project`, `cost-center`
---
## Kostnad og lisensiering
### Lisensmodeller og AI-kostnadsdekning
| Produkt | Lisensmodell | GPT-4.1-mini | GPT-4.1 | GPT-5 |
|---------|-------------|-------------|--------|-------|
| **Azure OpenAI** | Pay-per-token / PTU | Betalt separat | Betalt separat | Betalt separat |
| **Copilot Studio** | Per bruker/mnd | Basic Credits (inkludert) | Standard Credits (inkludert til volum-limit) | Premium Credits (tillegg ved høyt volum) |
| **Power Platform (premium)** | Per bruker/mnd | Basic prompt builder credits | Standard credits | Premium credits (ekstra) |
| **M365 Copilot** | Per bruker/mnd (~360 USD/bruker) | Inkludert | Inkludert | Standard-tilgang inkludert |
### GPT-5 tilgjengelighets- og registreringsstatus
| Modell | Tilgjengelighet | Registrering |
|--------|----------------|-------------|
| `gpt-5` | GA (begrenset) | Krever godkjenning (aka.ms/oai/gpt5access) |
| `gpt-5-mini` | GA | Ikke nødvendig |
| `gpt-5-nano` | GA | Ikke nødvendig |
| `gpt-5-chat` | Preview (2 versjoner) | Ikke nødvendig |
| `gpt-5-codex` | GA (begrenset) | Krever godkjenning |
| `gpt-5-pro` | GA (begrenset) | Kun MCA-E/Default-abonnementer |
---
## For arkitekten (Cosmo)
### Når bruke denne referansen
**Triggers:**
- Bruker spør om priser på GPT-4.1 eller GPT-5
- Bruker vil vite forskjellen mellom GPT-4.1-nano, mini og full
- Budsjettering av Azure OpenAI-kostnader (NOK)
- Valg mellom GPT-4.1 og GPT-5 for et gitt use case
- Copilot Credits-planlegging i Copilot Studio eller AI Builder
### Rådgivningsprosess
**1. Bekreft bruksbehovet:**
- Latenskrav (sanntid < 200ms? Batch OK?)
- Resonneringsbehov (enkel klassifisering vs. juridisk analyse)
- Volum (forespørsler/mnd, tokens/forespørsel)
- Compliance (Norway East, EU Data Zone, Global?)
- Platform (Azure OpenAI direkte, Copilot Studio, AI Builder)
**2. Velg modell med beslutningstreet:**
- Bruk treet i "Beslutningsveiledning"
- Default: Start med gpt-4.1-mini. Oppgrader kun ved bevist behov.
**3. Estimer kostnad:**
- Verifiserte priser (juni 2026): både gpt-4.1- og gpt-5-serien — bruk det kanoniske registeret (`deterministic-cost-calculation-model.md` §1.1)
- Husk: gpt-5 *-reasoning*-modeller fakturerer interne resonnerings-tokens som output — mål reelt forbruk
- Konverter til NOK (10.5 NOK/USD veiledende)
- Inkluder deployment-type-premie for Norway East
**4. Valider med offisiell kilde:**
- Alltid linke til [Azure OpenAI Pricing](https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/)
- For PTU: [Microsoft Foundry Calculator](https://ai.azure.com/resource/calculator)
### Confidence-markers i rådgivning
| Situasjon | Marker |
|-----------|--------|
| GPT-4.1-priser | "Bekreftet $2.00/$8.00 per 1M tokens (input/output)" |
| GPT-5-priser | "Bekreftet $1.25/$10.00 per 1M tokens (verifisert juni 2026) — kryssjekk Azure prisside" |
| NOK-konvertering | "Indikativt ved kurs 10.5 NOK/USD — verifiser aktuell kurs" |
| Copilot Credits | "Bekreftet Basic/Standard/Premium-klassifisering per modell" |
### Vanlige spørsmål og svar
**Q: "Er GPT-5 alltid bedre enn GPT-4.1?"**
**A:** Nei. GPT-5 er bedre for dyp resonnering. For sanntids-chatbots, høyvolum-RAG og enkle oppgaver er GPT-4.1 raskere og tilstrekkelig god. Merk at base-token-kosten nå er omtrent lik (gpt-5 $1.25/$10.00 vs gpt-4.1 $2.00/$8.00) — det reelle skillet er latens og at gpt-5 *-reasoning* genererer ekstra resonnerings-tokens (fakturert som output). Start med GPT-4.1 for enkle oppgaver; velg GPT-5 når resonnering faktisk trengs.
**Q: "Hva koster GPT-5 i Norge?"**
**A:** gpt-5 flagship koster $1.25 per 1M input-tokens og $10.00 per 1M output-tokens (Global Standard, verifisert juni 2026). Cached input $0.125. gpt-5-mini $0.25/$2.00, gpt-5-nano $0.05/$0.40. NB om residens: GPT-5 finnes **ikke** som regional deployment i Norway East — kun Global Standard/Provisioned (data prosesseres globalt). gpt-5.5 finnes via Data Zone Standard i Norway East (EU-residens); Data Zone-priser ligger typisk over Global Standard. Kryssjekk alltid Azure prisside for din region og deployment-type.
**Q: "Skal vi bruke gpt-4.1-mini eller gpt-4.1 i Copilot Studio?"**
**A:** Start med gpt-4.1-mini (Basic rate, laveste Credits-forbruk). Bytt til gpt-4.1 kun for oppgaver som krever mer kompleks resonnering eller høyere kvalitet — test og mål først.
**Q: "Hva er break-even for PTU vs. pay-per-token?"**
**A:** Bruk [Microsoft Foundry PTU-kalkulator](https://ai.azure.com/resource/calculator). Som tommelfingerregel: PTU er lønnsomt ved >70% gjennomsnittlig utnyttelse og stabilt volum over 3+ måneder.
**Q: "Påvirker ny GPT-5-tilgjengelighet Copilot Credits-forbruket vårt?"**
**A:** Ja. Hvis brukere i Copilot Studio velger gpt-5-reasoning (Preview, Premium rate) i stedet for gpt-4.1-mini (Basic), kan Credits-forbruket øke 510x. Overvåk forbruk via Power Platform admin center og sett budsjetter.
### Vanlige fallgruver
| Fallgruve | Konsekvens | Hvordan unngå |
|-----------|------------|---------------|
| Bruke gpt-5 *-reasoning* med `high` for enkle svar | Resonnerings-tokens (fakturert som output) kan mangedoble kosten | Start med gpt-4.1-mini/gpt-5-nano; bruk lav reasoning_effort der det holder |
| Ikke skille mellom Global og Regional prising | 1020% budsjett-avvik | Inkluder alltid deployment-type-premie i estimater for norsk sektor |
| Bruke utdaterte GPT-5-estimat-bånd ($1015/$4060) | 812x over-budsjettering | Bruk verifiserte priser ($1.25/$10.00) fra det kanoniske registeret |
| Glemme Batch API-rabatt for natt-jobber | 2x høyere kostnad enn nødvendig | Vurder Batch API for alle ikke-sanntids workloads |
| Ikke monitorere Copilot Credits-forbruk | Uventet faktura ved GPT-5/o3-bruk | Sett Credits-budsjetter i Power Platform admin center |
---
## Kilder og verifisering
### Primærkilder (Microsoft Learn, bekreftet februar 2026)
1. **GPT-5 vs GPT-4.1: choosing the right model for your use case**
URL: https://learn.microsoft.com/azure/foundry/foundry-models/how-to/model-choice-guide?view=foundry-classic
Hentet: 2026-02
Innhold: Modellsammenligning, reasoning-nivåer, latens-trade-offs, use-case guidance
2. **Foundry Models sold directly by Azure — GPT-4.1 og GPT-5-serien**
URL: https://learn.microsoft.com/azure/foundry/foundry-models/concepts/models-sold-directly-by-azure?view=foundry-classic
Hentet: 2026-02
Innhold: Kontekstvindu, max output tokens, treningsdata, versjonsoversikt, tilgjengelighetskrav
3. **Provisioned throughput unit (PTU) costs and billing**
URL: https://learn.microsoft.com/azure/foundry/openai/concepts/provisioned-throughput-billing?view=foundry-classic
Hentet: 2026-02
Innhold: PTU-kapasitet per modell (TPM/PTU), min deployment, latens-SLA, input/output-ratio (1:4 for gpt-4.1, 1:8 for gpt-5)
4. **Pricing for Azure Content Understanding in Foundry Tools**
URL: https://learn.microsoft.com/azure/ai-services/content-understanding/pricing-explainer
Hentet: 2026-02
Innhold: Priseksempler med gpt-4.1 Global ($2/$8) og gpt-4.1-mini Global ($0.40/$1.60) bekreftet
5. **Azure OpenAI in Foundry Models quotas and limits**
URL: https://learn.microsoft.com/azure/foundry/openai/quotas-limits?view=foundry-classic
Hentet: 2026-02
Innhold: GPT-5- og GPT-4.1-seriens kvotestruktur, usage tiers, deployment-typer
6. **Change the model version and settings (AI Builder/Copilot Studio)**
URL: https://learn.microsoft.com/microsoft-copilot-studio/prompt-model-settings
Hentet: 2026-02
Innhold: Copilot Credits-klassifisering (Basic/Standard/Premium) per modell, tilgjengelige modeller
7. **Cost management for fine-tuning**
URL: https://learn.microsoft.com/azure/foundry/openai/how-to/fine-tuning-cost-management?view=foundry-classic
Hentet: 2026-02
Innhold: Fine-tuning kostnad, hosting $1.70/time (o4-mini eksempel)
8. **Plan and manage costs for Microsoft Foundry**
URL: https://learn.microsoft.com/azure/foundry/concepts/manage-costs?view=foundry-classic
Hentet: 2026-02
Innhold: Billing-modell, token-basert prising, 1K-token enheter
### Referanseprisside (verifiser for oppdaterte tall)
9. **Azure OpenAI Pricing Page**
URL: https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/
Note: Dynamisk side (krever JavaScript). Sjekk manuelt for eksakte GPT-5-priser når de publiseres.
10. **Microsoft Foundry PTU Calculator**
URL: https://ai.azure.com/resource/calculator
Note: Beregn PTU break-even for spesifikke workloads
### Verifiseringsstatus
| Påstand | Kilde | Confidence |
|---------|-------|------------|
| gpt-4.1 Global: $2.00 input, $8.00 output per 1M | Kilde 4 (Content Understanding eksempel) | Høy |
| gpt-4.1-mini Global: $0.40 input, $1.60 output per 1M | Kilde 4 (Content Understanding eksempel) | Høy |
| gpt-5: 1 output token = 8 input tokens (PTU-ratio) | Kilde 3 (PTU-dokumentasjon) | Høy |
| gpt-4.1: 1 output token = 4 input tokens (PTU-ratio) | Kilde 3 (PTU-dokumentasjon) | Høy |
| gpt-4.1 PTU: 3 000 TPM/PTU | Kilde 3 | Høy |
| gpt-5 PTU: 4 750 TPM/PTU | Kilde 3 | Høy |
| gpt-4.1-mini Copilot: Basic rate | Kilde 6 | Høy |
| gpt-4.1 Copilot: Standard rate | Kilde 6 | Høy |
| gpt-5-reasoning Copilot: Premium rate | Kilde 6 | Høy |
| Batch API: 50% rabatt | Kilde 1/Azure prisside | Høy |
| gpt-5: $1.25 input / $10.00 output per 1M | WebSearch + OpenAI/Azure pricing (juni 2026) | Høy |
| gpt-5-nano: $0.05 / $0.40 per 1M | WebSearch (to kilder, juni 2026) | Høy |
| gpt-5-mini: $0.25 / $2.00 per 1M | OpenAI listepris; aggregatorer $0.125/$1.00 | Moderat |
| gpt-4.1-nano prising | Ikke direkte bekreftet, interpolert | Moderat |
**Totalt antall kilder:** 10 Microsoft Learn + WebSearch mot OpenAI API pricing & Azure OpenAI pricing (juni 2026)
**Verifiseringsmetode:** docs_search/docs_fetch (2026-02 baseline) + WebSearch-reverifisering av token-priser (2026-06)
### Siste oppdatering og gyldighet
**Dokumentasjonsdato:** Juni 2026 (token-priser re-baselined)
**Bekreftede priser gyldige per:** Juni 2026 (GPT-4.1-serien og GPT-5-serien)
**Kanonisk prissannhet:** `deterministic-cost-calculation-model.md` §1.1 — denne fila skal følge registeret
**Neste review anbefalt:** September 2026 (sjekk kvartalsvis; modellkatalogen 5.4/5.5 utvikler seg raskt)
---
**Dokumenteier:** Cosmo Skyberg, Microsoft AI Solution Architect
**Godkjent for:** Offentlig sektor Norge, Enterprise Azure-kunder
**Versjon:** 1.1 (token-priser verifisert juni 2026)