fix(ms-ai-architect): re-baseline kostnadslaget (GPT-5 $1.25/$10, én prissannhet, 10 filer)

Audit-funn Tema B + action-items 149/150. Verifiseringen avdekket at kostnadslag-råten var bredere enn auditens 3 navngitte filer (10 filer totalt).

- GPT-5 flagship $10-15/$40-60 -> $1.25/$10.00 (verifisert juni 2026, 8-12x for hoy). gpt-5-mini $0.25/$2.00, gpt-5-nano $0.05/$0.40. Fjernet falske "Verified MCP"-stempel pa estimat-band.

- deterministic-cost-calculation-model.md gjort til ENESTE kanoniske prissannhet (§1.1). Strippet duplikat pris-tabell fra cost-models.md (rotarsak til GPT-4o $10/$30-motsetning) -> peker til registeret.

- Reconcile-funn utover audit: deterministic hadde GPT-4.1-serien HALVERT ($1/$4 og $0.20/$0.80) -> verifisert $2.00/$8.00 og $0.40/$1.60. multi-model-strategy-costs.md NOK-tabell var fabrikkert 10-47x for hoy (gpt-4o 250/1000 NOK -> 26/105). model-selection (GPT-5 $3/$12), reasoning-models (GPT-5 $20-30/$80-100), token-counting (gpt-4.1 cached $1->$0.50), small-language-models (GPT-4o output 60->105 NOK) rettet.

- Recalk alle NOK-scenarioer reproduserbart: gpt-5 ~= gpt-4.1 i kost (ikke 30-55x dyrere som gammel tekst pasto) - billigere input ($1.25 vs $2.00), dyrere output. Reell kostnadsdriver = resonnerings-tokens (fakturert som output).

- Fjernet GPT-3.5 Turbo-anbefaling (utfaset). Alignet kurs 11->10.5 NOK/USD i cost-kommando. Cost-agent eksempel: legacy GPT-4 -> GPT-4o-mini, fjernet falskt Verified-stempel.

- kb-update apply cost-bucket deferret til task #8 (kommando-feature, ikke tall-justering).

Verifisert mot OpenAI API pricing + Azure OpenAI pricing via WebSearch 2026-06-18. validate-plugin.sh 219 PASS.

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>

Claude-Session: https://claude.ai/code/session_01REiKFhP4w6xGXXqWKpPCJJ
This commit is contained in:
Kjell Tore Guttormsen 2026-06-18 12:45:21 +02:00
commit 84e3cfaa03
10 changed files with 143 additions and 112 deletions

View file

@ -1,7 +1,8 @@
# Cost Models - Microsoft AI Platforms
**Last updated:** 2026-04 (research via microsoft-learn MCP)
**Last updated:** 2026-06 (token-pris-tabell strippet → kanonisk register; scenario-utregninger korrigert)
**Disclaimer:** Prices change frequently. Always verify at azure.microsoft.com/pricing
**Prissannhet:** Rå token-priser eies av `deterministic-cost-calculation-model.md` §1.1 — ikke dupliser tabeller her.
---
@ -37,14 +38,20 @@ Microsoft AI-plattformene har ulike prismodeller tilpasset forskjellige bruksomr
### Modellpriser (per 1 million tokens)
> **Token-priser vedlikeholdes ÉN plass.** Det kanoniske enhetspris-registeret ligger i `deterministic-cost-calculation-model.md` §1.1 (skills/ms-ai-security/references/cost-optimization/). Denne fila dupliserer ikke pris-tabeller — duplikatet skapte tidligere motstridende tall (GPT-4o sto her som $10/$30, mens registeret korrekt har $2.50/$10). Bruk alltid det kanoniske registeret for rå input/output-priser; ved konflikt vinner registeret.
**Hurtigankere (verifisert 2026-06 — kryssjekk alltid mot registeret):**
| Modell | Input | Output | Bruksområde |
|--------|-------|--------|-------------|
| **GPT-4o** | $10 | $30 | Generell bruk, balanse kostnad/kvalitet |
| **GPT-4o-mini** | $0.165 | $0.66 | Kostnadseffektiv, enklere oppgaver |
| **GPT-4 Turbo** | $10 | $30 | Komplekse oppgaver, lengre kontekst |
| **GPT-3.5 Turbo** | $0.50 | $1.50 | Enkel chat, høy hastighet |
| **o1-preview** (reasoning) | $15 | $60 | Kompleks resonnering, analyse |
| **o1-mini** (reasoning) | $3 | $12 | Rimeligere resonnering |
| **GPT-4o** | $2.50 | $10.00 | Generell bruk, balanse kostnad/kvalitet |
| **GPT-4o-mini** | $0.15 | $0.60 | Kostnadseffektiv, enklere oppgaver |
| **GPT-4.1** | $2.00 | $8.00 | Høyt volum, 1M kontekst |
| **GPT-4.1-mini** | $0.40 | $1.60 | Default i Copilot Studio |
| **GPT-5** | $1.25 | $10.00 | Dyp resonnering (registreringskrav) |
| **GPT-5-mini** | $0.25 | $2.00 | Resonnering ved moderat volum |
| **GPT-5-nano** | $0.05 | $0.40 | Klassifisering, høyt volum |
| **o3-mini** (reasoning) | $1.10 | $4.40 | Rimeligere resonnering |
**Vision-enabled models:**
- Bilder: 85–1105 tokens per bilde (avhenger av oppløsning)
@ -247,7 +254,7 @@ Azure AI Foundry er en **orkestreringsplattform** som benytter flere Azure-tjene
- Azure OpenAI (GPT-4o mini for sammendrag):
- Input: ~1M tokens (200 tokens/side × 10 sider × 500 docs)
- Output: ~100K tokens
- Kostnad: `(1M × $0.165/M) + (0.1M × $0.66/M) = $0.165 + $0.066 = $0.23`
- Kostnad: `(1M × $0.15/M) + (0.1M × $0.60/M) = $0.15 + $0.06 = $0.21`
- Document Intelligence:
- OCR: 5000 sider × basic meter ≈ $25–$50
- Storage/Compute: ~$10/måned
@ -285,10 +292,10 @@ Azure AI Foundry er en **orkestreringsplattform** som benytter flere Azure-tjene
- Azure OpenAI (GPT-4o):
- RAG input: 5M tokens/måned
- Output: 1M tokens/måned
- Kostnad: `(5M × $10/M) + (1M × $30/M) = $50 + $30 = $80`
- Kostnad: `(5M × $2.50/M) + (1M × $10/M) = $12.50 + $10 = $22.50`
- Compute (VM for hosting): ~$200/måned
**Månedskostnad: ~$385**
**Månedskostnad: ~$328**
---
@ -348,9 +355,9 @@ Azure AI Foundry er en **orkestreringsplattform** som benytter flere Azure-tjene
### Generelle strategier
**1. Right-size modellvalg**
- Bruk GPT-4o-mini for enkle oppgaver → 94% billigere enn GPT-4o
- Bruk GPT-3.5 Turbo for chat → 85% billigere enn GPT-4o
- Bruk reasoning models (o1) kun for komplekse problemer
- Bruk GPT-4o-mini for enkle oppgaver → ~94% billigere enn GPT-4o
- Bruk GPT-4.1-nano / GPT-5-nano for klassifisering og tagging → billigste nivå
- Bruk reasoning-modeller (GPT-5, o3-mini) kun for komplekse problemer
**2. Prompt engineering**
- Kortere prompts = færre input tokens
@ -590,4 +597,5 @@ Azure AI Foundry er en **orkestreringsplattform** som benytter flere Azure-tjene
- **2026-01:** Opprettet (basert på microsoft-learn MCP research)
- **2026-04:** Oppdatert — agent flow enforcement, billing URL oppdatert (Verified MCP 2026-04)
- **2026-06:** Token-pris-tabell strippet (fjernet duplikat som ga GPT-4o $10/$30-motsetning mot deterministic-registeret); erstattet med hurtigankere + peker til kanonisk register. Scenario 2 og 4 utregninger korrigert til verifiserte priser. GPT-3.5 Turbo-anbefaling fjernet (utfaset). Reasoning-modell-referanse o1 → GPT-5/o3-mini.
- **Disclaimer:** Priser endres hyppig; verifiser alltid via offisielle kilder før budsjettbeslutninger.

View file

@ -397,17 +397,18 @@ Reasoning models prises med **separate satser** for reasoning tokens og completi
**Eksempel (omtrentlige priser per 1M tokens):**
| Modell | Input Tokens | Reasoning Tokens | Output Tokens | Bruksområde |
|--------|--------------|------------------|---------------|-------------|
| `o1` | $15 | $60 | $60 | Balansert reasoning |
| `o3` | $10-20 | $60-80 | $60-80 | Standard reasoning |
| `o3-mini` | $1-3 | $15-25 | $15-25 | Kostnadseffektivt |
| `o4-mini` | $1-3 | $15-25 | $15-25 | Rask og billig |
| `gpt-5` | $20-30 | $80-100 | $80-100 | Premium reasoning |
| `gpt-5-mini` | $3-5 | $20-30 | $20-30 | Balansert premium |
| `codex-mini` | $1-3 | $15-25 | $15-25 | Kode-spesialist |
Reasoning-tokens faktureres til **output-raten** — de er ikke en egen prisklasse. Kolonnen «Reasoning Tokens» under viser derfor output-raten, og kostnaden skaleres med hvor mange reasoning-tokens modellen genererer.
**Merk:** Faktiske priser varierer basert på region, commitment og enterprise agreements. Reasoning tokens kan utgjøre 20-60% av total token count avhengig av effort-nivå.
| Modell | Input (per 1M) | Reasoning/Output (per 1M) | Bruksområde | Kilde |
|--------|----------------|---------------------------|-------------|-------|
| `gpt-5` | $1.25 | $10.00 | Premium reasoning | Verifisert juni 2026 |
| `gpt-5-mini` | $0.25 | $2.00 | Balansert | Verifisert juni 2026 |
| `gpt-5-nano` | $0.05 | $0.40 | Rask, billig reasoning | Verifisert juni 2026 |
| `o3-mini` | $1.10 | $4.40 | Kostnadseffektivt | Verifisert (register §1.1) |
| `o1` | $15.00 | $60.00 | Legacy, balansert | Legacy-rate |
| `o3` / `o4-mini` / `codex-mini` | verifiser | verifiser | Standard/rask reasoning | **Ikke re-verifisert — sjekk Azure prisside** |
**Merk:** Kanonisk prissannhet er `deterministic-cost-calculation-model.md` §1.1. Reasoning-tokens kan utgjøre 20–60 % av total token-count avhengig av effort-nivå — det er den reelle kostnadsdriveren for resonneringsmodeller, ikke base-raten.
### Optimaliseringstips