feat(ultraplan-local): v1.6.0 — /ultraresearch-local deep research command

Add /ultraresearch-local for structured research combining local codebase
analysis with external knowledge via parallel agent swarms. Produces research
briefs with triangulation, confidence ratings, and source quality assessment.

New command: /ultraresearch-local with modes --quick, --local, --external, --fg.
New agents: research-orchestrator (opus), docs-researcher, community-researcher,
security-researcher, contrarian-researcher, gemini-bridge (all sonnet).
New template: research-brief-template.md.

Integration: --research flag in /ultraplan-local accepts pre-built research
briefs (up to 3), enriches the interview and exploration phases. Planning
orchestrator cross-references brief findings during synthesis.

Design principle: Context Engineering — right information to right agent at
right time. Research briefs are structured artifacts in the pipeline:
ultraresearch → brief → ultraplan --research → plan → ultraexecute.

Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>
This commit is contained in:
Kjell Tore Guttormsen 2026-04-08 08:58:35 +02:00
commit baa2d0220b
488 changed files with 213221 additions and 0 deletions

View file

@ -0,0 +1,566 @@
# Model Selection for Cost-Efficiency
**Last updated:** 2026-02
**Status:** GA
**Category:** Cost Optimization & FinOps for AI
---
## Introduksjon
Valg av AI-modell har direkte innvirkning på både ytelse og kostnad. Microsoft Azure AI tilbyr et bredt spekter av modeller med ulike pris-/ytelsekarakteristikker — fra små, kostnadseffektive modeller som GPT-4o mini og GPT-4.1-nano, til store resonneringsmodeller som GPT-5. Riktig modellvalg kan redusere kostnader med 60-80% uten å ofre kvalitet for det aktuelle bruksområdet.
**Confidence:** Høy (basert på offisiell Microsoft-dokumentasjon, jan 2026)
Denne referansen gir strukturert veiledning for å velge mest kostnadseffektive modell basert på:
- Arbeidsbelastningens kompleksitet (reasoning vs. hurtige svar)
- Latenskrav (sanntid vs. batch)
- Volum (tokens per minutt, forespørsler per minutt)
- Budsjettrammer
**Nøkkelprinsipp:** Velg den minste modellen som oppfyller kvalitetskravene dine. Større modeller = høyere kostnader per token.
---
## Kjernekomponenter
### 1. Modellklasser og prisposisjonering
Microsoft Azure AI-plattformen tilbyr flere modellklasser med distinkte pris-/ytelsekarakteristikker:
| Modellklasse | Eksempler | Bruksområde | Relativ kostnad | Latens |
|--------------|-----------|-------------|-----------------|--------|
| **Resonneringsmodeller** | GPT-5, GPT-5-mini, GPT-5-nano | Kompleks analyse, multi-steg logikk, planlegging | Høyest | Høyere |
| **Store generelle modeller** | GPT-4.1, GPT-4o | Balansert ytelse, generelle oppgaver | Middels-høy | Moderat |
| **Små effektive modeller** | GPT-4.1-mini, GPT-4.1-nano, GPT-4o-mini | Høyt volum, sanntid, enklere oppgaver | Lavest | Lavest |
| **Spesialiserte modeller** | Embeddings, Whisper, DALL-E | Embeddings, tale, bilder | Varierer | Varierer |
**Confidence:** Høy (basert på Azure OpenAI-prisside og modellkatalog, feb 2026)
### 2. Token-basert prismodell
Azure OpenAI-tjenester prises per 1 000 tokens (1K) eller 1 million tokens (1M), avhengig av modell:
**GPT-4o mini (eksempel — verifiser på [Azure OpenAI pricing](https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/)):**
- Input: ~$0.15 per 1M tokens
- Output: ~$0.60 per 1M tokens
**GPT-4.1 (eksempel):**
- Input: ~$2.00 per 1M tokens
- Output: ~$8.00 per 1M tokens
**GPT-5 (eksempel):**
- Input: ~$3.00 per 1M tokens (varierer med reasoning-nivå)
- Output: ~$12.00 per 1M tokens
**Viktig:** Priser er illustrative. Sjekk alltid [offisiell prisside](https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/) for eksakte satser per region og modellversjon.
**Confidence:** Moderat (priseksempler fra dokumentasjon, men priser kan variere)
### 3. Deployment-typer og kostnadsimplikasjon
| Deployment-type | Prismodell | Best for | Kostnadspredikabilitet |
|-----------------|------------|----------|------------------------|
| **Standard** | Pay-per-token | Variabelt volum, testing | Lav (avhenger av bruk) |
| **Global Standard** | Pay-per-token (ingen data residency) | Høyt volum, global tilgang | Lav (avhenger av bruk) |
| **Provisioned Throughput (PTU)** | Fast PTU-time-pris | Forutsigbart volum, latens-SLA | Høy (fast kostnad) |
| **Developer Tier (fine-tuning)** | Pay-per-token, ingen hosting-fee | Evaluering, POC (auto-slettes etter 24t) | Lav (midlertidig) |
**PTU-eksempel:**
- 1 PTU = ~5 400 input tokens/minutt for o4-mini
- 1 PTU = ~3 000 input tokens/minutt for GPT-4.1
- PTU-pris varierer per avtale/reservasjon
**Confidence:** Høy (basert på Azure OpenAI deployment-dokumentasjon)
### 4. Fine-tuning kostnadsmønstre
Fine-tunede modeller har tre kostnadsdimensjoner:
| Kostnadselement | Beskrivelse | Eksempel (o4-mini) |
|-----------------|-------------|-------------------|
| **Training** | Per token i treningsfil | ~$1.10 per 1M tokens (input), $4.40 per 1M tokens (output) |
| **Hosting** | Per time deployed modell | $1.70/time (Standard/Global Standard) |
| **Inference** | Per token ved inferens | Samme som base-modell + hosting fee |
**Viktig:** Fine-tunede modeller påløper hosting-kostnad selv om de ikke brukes. Slett ubrukte deployments for å unngå unødvendige kostnader.
**Confidence:** Høy (basert på Azure OpenAI fine-tuning kostnadsdokumentasjon)
---
## Arkitekturmønstre
### Mønster 1: Model Router for dynamisk modellvalg
**Konsept:** Bruk Azure AI Foundry Model Router for å automatisk velge den mest kostnadseffektive modellen basert på prompt-kompleksitet.
**Fordeler:**
- Opptil 60% kostnadsreduksjon vs. alltid-bruk-GPT-5
- Automatisk ruting basert på kompleksitet
- Ingen kodeendringer nødvendig
**Implementering:**
1. Deploy Model Router i Azure AI Foundry
2. Konfigurer underliggende modeller (f.eks. GPT-4.1-nano, GPT-4.1-mini, GPT-4.1)
3. Model Router analyserer prompt og velger passende modell
**Use case:** Chatbots, kundesupport, assistenter med varierende spørsmålskompleksitet
**Confidence:** Høy (Model Router er GA-funksjonalitet i Azure AI Foundry)
### Mønster 2: Tiered model strategy (Small → Medium → Large)
**Konsept:** Kaskaderende modellvalg basert på oppgavetype:
| Tier | Modell | Bruksområde | Kostnad/1M tokens (illustrativt) |
|------|--------|-------------|----------------------------------|
| **Tier 1** | GPT-4.1-nano | Enkel triage, klassifisering, korte svar | ~$0.50 input, ~$2.00 output |
| **Tier 2** | GPT-4.1-mini | Moderat kompleksitet, standarddrafting | ~$1.00 input, ~$4.00 output |
| **Tier 3** | GPT-4.1 / GPT-5-mini | Kompleks analyse, resonnering | ~$2.00-3.00 input, ~$8.00-12.00 output |
**Implementering:**
```python
def select_model(task_complexity: str):
if task_complexity == "simple":
return "gpt-4.1-nano"
elif task_complexity == "moderate":
return "gpt-4.1-mini"
else:
return "gpt-5-mini"
```
**ROI-eksempel:**
- 1 million forespørsler/måned
- 70% simple (Tier 1), 25% moderate (Tier 2), 5% komplekse (Tier 3)
- Estimert besparelse: 50-70% vs. alltid bruke GPT-4.1
**Confidence:** Høy (best practice-mønster dokumentert i Azure-veiledning)
### Mønster 3: Reasoning-nivå optimalisering (GPT-5)
**Konsept:** For GPT-5-modeller, juster reasoning-nivå basert på oppgavekompleksitet.
| Reasoning-nivå | Latens | Kostnad | Nøyaktighet | Bruksområde |
|----------------|--------|---------|-------------|-------------|
| **Minimal** | Raskest | Lavest | Lavest | Bulk-operasjoner, enkle transformasjoner |
| **Low** | Rask | Lav | Moderat | Triage, korte svar, enkle redigeringer |
| **Medium (default)** | Moderat | Middels | God | Innholdsdrafting, moderat koding, RAG Q&A |
| **High** | Sakte | Høyest | Høyest | Kompleks planlegging, analyse, multi-hop reasoning |
**Implementering:**
```python
response = client.responses.create(
model="gpt-5",
reasoning_effort="low", # Juster basert på oppgave
input=[{"role": "user", "content": "Simple query"}]
)
```
**Kostnadssparepotensial:** 40-60% for oppgaver som ikke krever deep reasoning.
**Confidence:** Høy (reasoning-nivåer er dokumentert GPT-5-funksjonalitet)
### Mønster 4: Batch processing for ikke-sanntidsoppgaver
**Konsept:** Bruk batch-prosessering med billigere modeller for oppgaver uten sanntidskrav.
**Fordeler:**
- Lavere kostnader (batch-rabatter hvis tilgjengelig)
- Kan bruke mindre modeller med lengre behandlingstid
- Bedre ressursutnyttelse
**Use case:**
- Nattlig rapportgenerering
- E-postsammendrag
- Innholdsmoderering (ikke-sanntid)
- Databearbeiding
**Confidence:** Moderat (batch processing er best practice, men ikke alltid prisrabattert)
### Mønster 5: Prompt optimization for token-reduksjon
**Konsept:** Reduser token-bruk gjennom prompt-optimalisering:
| Teknikk | Token-besparelse | Implementering |
|---------|------------------|----------------|
| **Fjern verbose instruksjoner** | 10-30% | Konsis prompts, fjern overflødige ord |
| **Few-shot → Zero-shot** | 20-50% | Fjern eksempler hvis modellen håndterer det |
| **Kontekst-komprimering** | 30-60% | Bruk embeddings/semantic search for relevant kontekst |
| **Output length limiting** | Varierer | Sett `max_tokens` eksplisitt |
**ROI-eksempel:**
- Original prompt: 500 tokens input, 200 tokens output
- Optimalisert prompt: 250 tokens input, 150 tokens output
- Token-reduksjon: 50% input, 25% output
- Kostnadssparing: ~40-45% per forespørsel
**Confidence:** Høy (token-optimalisering er best practice)
---
## Beslutningsveiledning
### Beslutningstre for modellvalg
```
START
Krever oppgaven deep reasoning/multi-step logikk?
├─ JA → Velg GPT-5 (juster reasoning-nivå)
└─ NEI → Er latens kritisk (< 200ms)?
├─ JA → Velg GPT-4.1-nano eller GPT-4.1-mini
└─ NEI → Er oppgaven kompleks?
├─ JA → Velg GPT-4.1 eller GPT-4.1-mini
└─ NEI → Velg GPT-4.1-nano (billigste)
```
### Scenario-basert modellanbefaling
| Scenario | Anbefalt modell | Begrunnelse |
|----------|-----------------|-------------|
| **Kundesupport chatbot** | GPT-4.1-mini + Model Router | Balanse mellom kostnad og kvalitet, dynamisk tilpasning |
| **Kodegenerering** | GPT-5-mini (medium reasoning) | Krever resonnering, men ikke maksimal |
| **Dokumentanalyse (juridisk/finans)** | GPT-5 (high reasoning) | Høy nøyaktighet viktigere enn kostnad |
| **E-postklassifisering** | GPT-4.1-nano | Enkel oppgave, høyt volum |
| **RAG-basert Q&A** | GPT-4.1-mini | Moderat kompleksitet, kontekst fra retrieval |
| **Innholdsmoderering** | GPT-4.1-nano + Content Safety | Høyt volum, enkel klassifisering |
| **Enterprise Copilot** | GPT-5 (medium reasoning) + GPT-4.1-mini fallback | Komplekse oppgaver krever resonnering, enkle bruker mini |
**Confidence:** Høy (basert på Microsoft best practices og modellkarakteristikker)
### Kvantitativ ROI-kalkulator (konseptuell)
**Input:**
- Månedlig forespørselsvolum: N
- Gjennomsnittlig input tokens: I
- Gjennomsnittlig output tokens: O
- Nåværende modell: M_current
- Foreslått modell: M_new
**Beregning:**
```
Total tokens/måned = N × (I + O)
Kostnad_current = (I × pris_input_M_current + O × pris_output_M_current) × N / 1 000 000
Kostnad_new = (I × pris_input_M_new + O × pris_output_M_new) × N / 1 000 000
Månedlig besparelse (NOK) = (Kostnad_current - Kostnad_new) × USD_to_NOK
```
**Eksempel:**
- 1M forespørsler/måned, 200 input tokens, 100 output tokens
- Current: GPT-4.1 ($2.00 input, $8.00 output per 1M tokens)
- New: GPT-4.1-mini ($1.00 input, $4.00 output per 1M tokens)
- Kostnad_current = (200 × $2.00 + 100 × $8.00) × 1 / 1000 = $1 200
- Kostnad_new = (200 × $1.00 + 100 × $4.00) × 1 / 1000 = $600
- Besparelse: $600/måned (~6 600 NOK/måned ved USD 1 = NOK 11)
**Confidence:** Moderat (priseksempler er illustrative, faktiske priser varierer)
---
## Integrasjon med Microsoft-stakken
### Azure AI Foundry Model Catalog
**Tilgang til modellkatalog:**
1. Gå til [Azure AI Foundry](https://ai.azure.com)
2. Velg **Model Catalog** i venstre meny
3. Filtrer på "Azure OpenAI" for Microsoft-modeller
4. Sammenlign modeller basert på:
- Input/output token-priser
- Context window size
- Capabilities (vision, function calling, etc.)
- Regional tilgjengelighet
**Confidence:** Høy (Azure AI Foundry er GA)
### Azure Cost Management + Budgets
**Integrasjon for kostnadssporing:**
| Funksjon | Beskrivelse | Verdi |
|----------|-------------|-------|
| **Cost Analysis** | Per-modell kostnadsinnsikt via deployment tags | Identifiser dyreste modeller |
| **Budgets + Alerts** | Varsler ved kostnadsterskler | Forhindre budsjettoverskridelser |
| **Export til Storage** | Daglig/ukentlig kostnadseksport | Dypere analyse i Power BI/Excel |
**Implementering:**
1. Gå til Azure Portal → Cost Management
2. Opprett budget scoped til resource group
3. Sett alerts ved 50%, 75%, 90% av budsjett
4. Grupper kostnader etter "Meter" for å se per-modell kostnad
**Confidence:** Høy (Cost Management er standard Azure-funksjonalitet)
### Power Platform AI Builder
**Modellvalg i AI Builder:**
- AI Builder bruker **Azure OpenAI GPT-4o-mini** som default for generative oppgaver (per desember 2024)
- Ingen direkte modellvalg tilgjengelig i AI Builder-grensesnittet
- Kostnader inkludert i AI Builder credits (500 credits/bruker/måned i premium-planer)
**Optimalisering:**
- Begrens prompt-lengde
- Bruk structured outputs for å redusere token-bruk
**Confidence:** Moderat (basert på Power Platform dokumentasjon)
### Copilot Studio
**Modellstrategi i Copilot Studio:**
- Copilot Studio bruker Azure OpenAI-modeller (GPT-4o eller GPT-4.1-serien)
- Licenskostnad dekker inferenskostnader (per Q2 2024)
- Vurder Generative Answers vs. custom topics for kostnadskontroll
**Optimalisering:**
- Bruk Boosted Conversations kun når nødvendig
- Optimaliser Generative Answers med tydelige fallback-scenarier
**Confidence:** Moderat (Copilot Studio-lisensiering kan endre seg)
---
## Offentlig sektor (Norge)
### Kostnadskontroll i offentlige anskaffelser
**Krav til kostnadstransparens:**
- Offentlige virksomheter må kunne dokumentere kostnader per tjeneste/bruker
- Azure Cost Management gir nødvendig sporbarhet
- Tagging-strategi anbefales: `project`, `department`, `cost-center`
**Anbefaling:**
- Etabler månedlig kostnadsrapportering per prosjekt
- Bruk PTU (Provisioned Throughput) for forutsigbare budsjetter i produksjon
- Test med Standard deployment, migrer til PTU ved stabil bruk
**Confidence:** Høy (basert på generell offentlig sektor best practice)
### Compliance og dataplassering
**Kostnad vs. compliance:**
- **Standard deployment** (regional): Høyere kostnad, garantert data residency i Norge
- **Global Standard**: Lavere kostnad, ingen data residency-garanti
**Anbefaling for offentlig sektor:**
- Velg **Standard deployment i Norway East** for personopplysninger (GDPR)
- Vurder Global Standard for ikke-sensitive workloads (potensielt 10-20% billigere)
**Confidence:** Høy (basert på Azure OpenAI deployment-dokumentasjon)
### TCO for offentlig AI-satsning
**Total Cost of Ownership-komponenter:**
| Kostnadselement | Estimat (årlig, små prosjekter) | Optimalisering |
|-----------------|----------------------------------|----------------|
| **Azure OpenAI inferens** | 50 000 - 200 000 NOK | Modellvalg, prompt-optimalisering |
| **Azure AI Search (RAG)** | 30 000 - 100 000 NOK | Indeksoptimalisering, partitioning |
| **Azure Storage** | 5 000 - 20 000 NOK | Lifecycle policies |
| **Azure Monitor/App Insights** | 10 000 - 30 000 NOK | Sampling, log retention |
| **Lisenser (Copilot Studio)** | 200 - 2 000 NOK/bruker/måned | Pilot med få brukere først |
**Total estimert TCO (små prosjekter):** 100 000 - 500 000 NOK/år (ekskl. personellkostnader)
**Confidence:** Lav-Moderat (estimater er generelle, varierer betydelig per use case)
---
## Kostnad og lisensiering
### Lisensmodeller for Microsoft AI
| Produkt | Lisensmodell | AI-kostnad inkludert? | Ekstra kostnad |
|---------|--------------|------------------------|----------------|
| **Azure OpenAI** | Pay-per-token eller PTU | Nei | Basert på bruk eller PTU-reservasjon |
| **Copilot Studio** | Per bruker/måned (~$200/måned) | Ja (inferens inkludert) | Økt bruk kan koste ekstra |
| **Power Platform (premium)** | Per bruker/måned (~$40/bruker) | Delvis (500 AI Builder credits/bruker) | Ytterligere credits må kjøpes |
| **M365 Copilot** | Per bruker/måned (~$360/bruker) | Ja (inferens inkludert) | Ingen ekstra kostnad |
**Viktig:** Priser er illustrative per januar 2026. Verifiser på [Microsoft lisensside](https://www.microsoft.com/licensing/).
**Confidence:** Moderat (lisenser endres regelmessig)
### Cost avoidance-strategier
| Strategi | Potensial besparelse | Kompleksitet |
|----------|----------------------|--------------|
| **Bytt fra GPT-4.1 til GPT-4.1-mini** | 50% | Lav (krever testing) |
| **Bruk Model Router** | 30-60% | Middels (Azure AI Foundry-setup) |
| **Prompt-optimalisering** | 20-40% | Lav (kan gjøres iterativt) |
| **Fine-tuning for å erstatte større modell** | 40-70% | Høy (krever treningsdata og vedlikehold) |
| **Migrering til PTU (ved høyt volum)** | 20-50% | Middels (krever volumprediksjon) |
| **Caching (for repeterende prompts)** | 10-30% | Lav-Middels (krever cache-logikk) |
**Confidence:** Moderat (besparelsespotensial varierer per use case)
### Regional prisvariasjoner
**Eksempel (verifiser på Azure-prisside):**
- Norway East: Standard pricing
- West Europe: Standard pricing
- East US: ~5-10% billigere (ikke-europeisk region)
**Anbefaling for norske virksomheter:**
- Bruk Norway East for compliance-sensitive data
- Vurder West Europe for ikke-sensitive workloads (latens vs. kostnad)
**Confidence:** Moderat (prisvariasjon finnes, men er ofte marginal)
---
## For arkitekten (Cosmo)
### Når bruke denne referansen
**Triggers:**
- Bruker spør: "Hvilken modell bør jeg bruke for [use case]?"
- Bruker ønsker kostnadsoptimalisering av eksisterende løsning
- Bruker planlegger høyvolum-deployment og er bekymret for kostnad
- Bruker vil sammenligne GPT-4o-mini vs. GPT-4.1 vs. GPT-5
### Rådgivningsprosess
**1. Forstå use case:**
- Hva skal modellen gjøre? (klassifisering, generering, resonnering)
- Hva er volumet? (forespørsler/dag, tokens per forespørsel)
- Hva er latenskrav? (sanntid vs. batch)
**2. Foreslå modellstrategi:**
- Bruk beslutningstreet i "Beslutningsveiledning"
- Anbefal tiered approach hvis varierende kompleksitet
- Vurder Model Router for dynamisk ruting
**3. Estimer kostnader:**
- Bruk ROI-kalkulatoren (konseptuell seksjon)
- Sammenlign nåværende vs. foreslått modell
- Inkluder TCO (ikke bare inferenskostnad)
**4. Anbefal testing:**
- "Start med GPT-4.1-mini, evaluer kvalitet"
- "Opprett evaluation dataset for sammenligning"
- "Test i 1-2 uker før full rollout"
**5. Oppfølging:**
- Sett opp Cost Management alerts
- Følg opp med Azure Monitor for ytelsesmetrikker
- Juster modellvalg basert på faktisk bruk
### Typiske spørsmål og svar
**Q: "Skal jeg alltid bruke billigste modell?"**
**A:** Nei. Velg den minste modellen som oppfyller kvalitetskravene. Hvis GPT-4.1-nano gir 70% kvalitet men GPT-4.1-mini gir 95%, kan ekstra kostnad være verdt det.
**Q: "Hvordan vet jeg om GPT-4.1-mini er god nok vs. GPT-4.1?"**
**A:** Opprett et evaluation dataset (50-100 representative eksempler), kjør begge modeller, sammenlign output. Bruk Azure AI Foundry evaluations for strukturert testing.
**Q: "Er fine-tuning alltid billigere?"**
**A:** Nei. Fine-tuning har opfront-kostnad (training) og hosting-kostnad ($1.70/time). Kun kostnadseffektivt ved høyt volum (>100K forespørsler/måned) eller hvis du kan erstatte GPT-4.1 med fine-tuned GPT-4.1-mini.
**Q: "Hvordan optimalisere kostnader for RAG-løsning?"**
**A:**
1. Bruk semantic search for å redusere kontekst-tokens
2. Velg GPT-4.1-mini for spørsmål med god retrieval
3. Fallback til GPT-4.1 hvis ikke confident svar
4. Optimaliser chunking-strategi i Azure AI Search
### Confidence markers i rådgivning
Bruk alltid confidence markers når du anbefaler modeller:
- **Høy confidence:** "GPT-4.1-mini er dokumentert 50% billigere enn GPT-4.1 for samme deployment-type."
- **Moderat confidence:** "Basert på lignende use cases, forventer jeg 30-50% kostnadsreduksjon."
- **Lav confidence:** "Uten å teste på ditt spesifikke dataset, er det vanskelig å si om GPT-4.1-nano vil være tilstrekkelig."
### Verktøy for kostnadsestimering
**Anbefal alltid:**
1. [Azure Pricing Calculator](https://azure.microsoft.com/pricing/calculator/) for estimering
2. [Azure AI Foundry Calculator](https://ai.azure.com/resource/calculator) for PTU-estimering
3. Azure Cost Management for faktisk kostnadssporing
### Vanlige fallgruver
| Fallgruve | Konsekvens | Hvordan unngå |
|-----------|------------|---------------|
| **Alltid bruke GPT-5** | 3-5x høyere kostnad | Vurder GPT-4.1-mini eller GPT-4.1 først |
| **Glemme hosting-kostnad for fine-tuning** | $1.70/time × 24 × 30 = $1 224/måned | Slett ubrukte fine-tuned deployments |
| **Ikke sette max_tokens** | Unødvendig lange svar = høyere output-kostnad | Sett `max_tokens` eksplisitt |
| **Bruke Standard over Global Standard uten grunn** | 10-20% høyere kostnad | Velg Global Standard hvis data residency ikke kreves |
| **Ikke monitere kostnader** | Uventede regninger | Sett opp Cost Management alerts |
---
## Kilder og verifisering
### Primærkilder (Microsoft Learn)
1. **GPT-5 vs GPT-4.1: choosing the right model for your use case**
URL: https://learn.microsoft.com/en-us/azure/ai-foundry/foundry-models/how-to/model-choice-guide?view=foundry-classic
Hentet: 2026-02
Innhold: Modellsammenligninger, latency trade-offs, reasoning-nivåer
2. **Plan to manage costs for Azure OpenAI in Azure AI Foundry Models**
URL: https://learn.microsoft.com/en-us/azure/ai-foundry/openai/how-to/manage-costs
Hentet: 2026-02
Innhold: Billing models, token pricing, cost monitoring
3. **Cost management for fine-tuning**
URL: https://learn.microsoft.com/en-us/azure/ai-foundry/openai/how-to/fine-tuning-cost-management?view=foundry-classic
Hentet: 2026-02
Innhold: Training costs, hosting costs, deployment types
4. **Optimize model cost and performance**
URL: https://learn.microsoft.com/en-us/azure/ai-foundry/control-plane/how-to-optimize-cost-performance?view=foundry
Hentet: 2026-02
Innhold: Model Router, cost optimization workflows
5. **Azure OpenAI in Azure AI Foundry Models**
URL: https://learn.microsoft.com/en-us/azure/ai-foundry/openai/concepts/models
Hentet: 2026-02
Innhold: Model catalog, capabilities, regional availability
6. **Understanding costs associated with provisioned throughput units (PTU)**
URL: https://learn.microsoft.com/en-us/azure/ai-foundry/openai/how-to/provisioned-throughput-onboarding
Hentet: 2026-02
Innhold: PTU pricing, throughput per PTU, when to use PTU
### Sekundærkilder
7. **Azure OpenAI Pricing Page**
URL: https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/
Note: Offisiell prisside (sjekk for oppdaterte priser)
8. **Azure Pricing Calculator**
URL: https://azure.microsoft.com/pricing/calculator/
Note: For pre-deployment estimering
9. **Azure AI Foundry Calculator**
URL: https://ai.azure.com/resource/calculator
Note: For PTU-estimering
### Verifiseringsstatus
| Påstand | Kilde | Confidence |
|---------|-------|------------|
| GPT-4.1-mini er 50% billigere enn GPT-4.1 | Source 2, illustrative pricing examples | Høy |
| Model Router kan spare opptil 60% | Source 4 | Høy |
| Fine-tuning hosting cost er $1.70/time | Source 3 | Høy |
| GPT-5 har fire reasoning-nivåer | Source 1 | Høy |
| PTU gir 3 000 input TPM per PTU for GPT-4.1 | Source 6 | Høy |
**Totalt antall kilder:** 9 (6 primære Microsoft Learn-artikler, 3 pricing-referanser)
**MCP-kall brukt:** 6 (4x docs_search, 2x docs_fetch)
### Siste oppdatering og gyldighet
**Dokumentasjonsdato:** Januar-februar 2026
**Priser gyldige per:** Februar 2026 (illustrative — verifiser alltid på offisiell prisside)
**Modeller i GA:** GPT-4.1-serien, GPT-4o-mini, GPT-5-serien (per januar 2026)
**Neste review anbefalt:** Juni 2026 (Microsoft oppdaterer priser kvartalsvis)
---
**Dokumenteier:** Cosmo Skyberg, Microsoft AI Solution Architect
**Godkjent for:** Offentlig sektor Norge, Enterprise Azure-kunder
**Versjon:** 1.0