feat(ms-ai-architect): Spor 1 — Port-1-substrat migrert på 4 ikke-advisor-skills (243 Source + 327 Type + 325 TOC + stale-verified poison fjernet) [skip-docs]
Steg 9 (R4): unified migrate-corpus.mjs --write over engineering/governance/ infrastructure/security. 327 filer mutert, verified=null, prosa byte-identisk (fra første ## seksjon), advisor urørt (0 endringer). To applier-fixes oppdaget under kjøring (TDD, RED→GREEN): - insertHeaderFields: anker faller nå tilbake når en meta-linje selv passerer 500B (2 filer pakket et avsnitt i **Status:** → Type/Source landet utenfor scan-vinduet, applierens post-write-assertion fanget + restaurerte). - normalizeStaleVerified: fjerner nå ALLE stale non-date **Verified:** i 500B-vinduet, inkl. stray body-dup rett under --- (9 mlops-genaiops-filer var ellers falskt "verified"/fresh, droppet fra worklist). Operatør-godkjent utvidelse av carve-out; kun stray metadata-linjer, aldri prosa. test-transform-criterion: precondition oppdatert til post-migrasjons-sannhet (fila bærer nå Source). Suite 728/728 grønn.
This commit is contained in:
parent
ed92d65385
commit
ddce43d8b2
330 changed files with 4643 additions and 83 deletions
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-02
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/ai-builder/credit-management
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter](#kjernekomponenter)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
AI Builder er Microsofts low-code AI-plattform som inngår i Power Platform. Historisk har AI Builder brukt en egen kredittmodell (AI Builder credits) for å regulere forbruk av AI-funksjoner i Power Apps og Power Automate. I oktober 2025 annonserte Microsoft en progressiv avvikling av AI Builder credits til fordel for en felles kredittmodell basert på Copilot Credits.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-19
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/foundry/concepts/manage-costs
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter](#kjernekomponenter)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Cost governance i Microsoft Foundry representerer det strukturelle rammeverket som forhindrer ukontrollert AI-forbruk og sikrer at AI-investeringer forblir innenfor budsjetterte rammer. I motsetning til tradisjonell cloud-kostnadsstyring, krever AI-arbeidsbelastninger spesialiserte kontroller som håndterer både infrastrukturkostnader (compute, storage) og forbruksbaserte kostnader (tokens, API-kall, modelldeployments).
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-19
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/cost-management-billing/costs/tutorial-acm-create-budgets
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter](#kjernekomponenter)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Azure Cost Management er Microsofts innebygde plattform for kostnadsovervåking, budsjettering og optimalisering på tvers av alle Azure-ressurser. For AI-workloads er økonomisk styring spesielt kritisk fordi token-baserte modeller, GPU-compute og storage-intensive RAG-løsninger kan generere uforutsigbare kostnader hvis de ikke overvåkes systematisk.
|
||||
|
|
|
|||
|
|
@ -4,9 +4,22 @@
|
|||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
**Source:** https://learn.microsoft.com/azure/foundry/openai/how-to/batch
|
||||
**Type:** reference
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter / Nøkkelegenskaper](#kjernekomponenter--nøkkelegenskaper)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Azure OpenAI Batch API er designet for å håndtere storskala- og høyvolumsbehandling av AI-oppgaver effektivt. Ved å prosessere asynkrone grupper av requests i batch-format, fremfor én og én request, oppnår organisasjoner **50% kostnadsreduksjon** sammenlignet med standard global deployment. Batch API benytter separat enqueued token-kvote, som sikrer at batch-jobber ikke forstyrrer sanntidsapplikasjoner.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-19
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/foundry/concepts/manage-costs
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter](#kjernekomponenter)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Budget forecasting og finansiell planlegging er kritiske disipliner for AI-prosjekter i Microsoft-stakken. Mens tradisjonell IT-budsjettforing opererer med forutsigbare kapasitetsmodeller, introduserer AI-arbeidsbelastninger nye utfordringer: token-basert forbruk, uforutsigbare skaleringsmønstre, og kostnadsvarians knyttet til modellvalg og treningsfrekvens.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-19
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/cloud-adoption-framework/scenarios/ai/platform/governance
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter](#kjernekomponenter)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Cost allocation og chargeback er fundamentale FinOps-kapabiliteter for å håndtere delte kostnader og skape kostnadsansvar i organisasjoner som bruker Microsoft AI-plattformer. Disse mekanismene lar deg omfordele kostnader fra sentrale, delte tjenester til de faktiske forbrukerne — som team, avdelinger eller prosjekter — og dermed sikre både transparens og ansvarliggjøring.
|
||||
|
|
|
|||
|
|
@ -4,9 +4,24 @@
|
|||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
**Rolle:** Kanonisk prissannhet — eneste autoritative enhetspris-register for pluginen
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/copilot/microsoft-365/microsoft-365-copilot-licensing
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Seksjon 1: Enhetspris-register](#seksjon-1-enhetspris-register)
|
||||
- [Seksjon 2: Eksplisitte beregningsformler](#seksjon-2-eksplisitte-beregningsformler)
|
||||
- [Seksjon 3: P10/P50/P90 konfidensintervaller](#seksjon-3-p10p50p90-konfidensintervaller)
|
||||
- [Seksjon 4: Mellomregnings-format](#seksjon-4-mellomregnings-format)
|
||||
- [Seksjon 5: Valutakonvertering USD → NOK](#seksjon-5-valutakonvertering-usd--nok)
|
||||
- [Seksjon 6: Typiske referansearkitekturer — kostnadsprofiler](#seksjon-6-typiske-referansearkitekturer--kostnadsprofiler)
|
||||
- [Seksjon 7: Oppdatering og vedlikehold](#seksjon-7-oppdatering-og-vedlikehold)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
- [For Cosmo Skyberg](#for-cosmo-skyberg)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Kostnadsestimater i AI-arkitekturvurderinger lider ofte av tvetydighet: runde tall uten kilde, manglende mellomregning, og uklare konfidensintervaller. Denne referansen definerer en **deterministisk beregningsmodell** som fjerner all tvetydighet fra kostnadsestimater.
|
||||
|
|
|
|||
|
|
@ -3,10 +3,23 @@
|
|||
**Last updated:** 2026-06 | Priser verifisert: WebSearch + OpenAI/Azure pricing juni 2026
|
||||
**Status:** GA (GPT-4.1-serien), GA (GPT-5-serien — `gpt-5` og `gpt-5-codex` har registreringskrav). GPT-5.2 reasoning og GPT-5.3 chat lagt til i Copilot Studio-prompt-builder
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/foundry/concepts/manage-costs
|
||||
**Prissannhet:** Rå token-priser eies av `deterministic-cost-calculation-model.md` §1.1 (kanonisk register). Denne fila gir kontekst, scenarioer og rådgivning — ved tallkonflikt vinner registeret.
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter](#kjernekomponenter)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
GPT-5- og GPT-4.1-seriene er de to nyeste flaggskipmodellene fra OpenAI tilgjengelig i Microsoft Foundry. De representerer to distinkte designfilosofier: GPT-5 optimalisert for dyp resonnering og komplekse oppgaver, GPT-4.1 optimalisert for hastighet, gjennomstrømming og kostnadseffektivitet.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/foundry/concepts/manage-costs
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter](#kjernekomponenter)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Managed inference endpoints i Azure Machine Learning og Microsoft Foundry representerer en betydelig kostnadsfaktor i AI-prosjekter, men de tilbyr også omfattende muligheter for kostnadsoptimalisering gjennom riktig konfigurasjon og strategisk ressursforvaltning. Denne kunnskapsreferansen dekker både managed compute endpoints (Azure ML) og serverless API endpoints (Microsoft Foundry), med fokus på praktiske optimaliseringsstrategier som kan redusere Total Cost of Ownership (TCO) uten å kompromittere på ytelse eller tilgjengelighet.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-02
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/cloud-adoption-framework/scenarios/ai/plan
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter / Nøkkelegenskaper](#kjernekomponenter--nøkkelegenskaper)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Lisenskostnader er ofte den største enkeltposten i organisasjoners Microsoft-budsjett, og med introduksjonen av AI-kapabiliteter gjennom Microsoft 365 Copilot, Azure AI Services, og Power Platform AI har kompleksiteten økt dramatisk. En moderne Microsoft AI-organisasjon må forholde seg til et flerlags lisensieringslandskap som inkluderer base-lisenser (M365 E3/E5, Business Premium), add-on-lisenser (Microsoft 365 Copilot, AI Builder), consumption-baserte modeller (Azure OpenAI, AI Search), og seeded credits som endrer seg over tid.
|
||||
|
|
|
|||
|
|
@ -4,9 +4,22 @@
|
|||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
**Source:** https://learn.microsoft.com/azure/foundry/foundry-models/concepts/models-sold-directly-by-azure
|
||||
**Type:** reference
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter](#kjernekomponenter)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Valg av AI-modell har direkte innvirkning på både ytelse og kostnad. Microsoft Azure AI tilbyr et bredt spekter av modeller med ulike pris-/ytelsekarakteristikker — fra små, kostnadseffektive modeller som GPT-4o mini og GPT-4.1-nano, til store resonneringsmodeller som GPT-5. Riktig modellvalg kan redusere kostnader med 60-80% uten å ofre kvalitet for det aktuelle bruksområdet.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-19 | Verified: MCP 2026-06
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/foundry/foundry-models/concepts/models-sold-directly-by-azure
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter](#kjernekomponenter)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Moderne AI-løsninger krever ofte forskjellige modellkapabiliteter for ulike oppgaver. En multi-model strategy innebærer intelligent routing av requests til den mest kostnadseffektive modellen som tilfredsstiller kvalitetskravene. Med Azure OpenAI-modeller som varierer fra GPT-4.1-nano (59 400 tokens/PTU) til GPT-5 (4 750 tokens/PTU) kan besparelsene være betydelige — opptil 90% kostnadsdifferanse mellom modeller for enkle oppgaver.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-19 | Verified: MCP 2026-06
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/azure-monitor/app/opentelemetry-configuration
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter](#kjernekomponenter)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Observability og monitoring er kritiske for produksjonsklare AI-løsninger, men kan raskt bli en betydelig kostnadsfaktor hvis de ikke konfigureres riktig. Azure Monitor, Application Insights og Log Analytics workspace representerer ofte 15-30% av den totale driftskostnaden for AI-workloads. Denne referansen fokuserer på strategier for å optimalisere kostnader knyttet til telemetri-innsamling, lagring og spørringer, samtidig som du opprettholder nødvendig innsikt i systemets helse og ytelse.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/foundry/concepts/manage-costs
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter](#kjernekomponenter)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Prompt engineering er en av de mest kostnadseffektive optimaliseringsstrategiene for Azure OpenAI-løsninger. Siden prismodellen er basert på antall tokens (både input og output), kan godt utformede prompts redusere kostnader med 30-70% uten å kompromittere kvaliteten på responsen. Dette handler om å maksimere verdien av hver token som sendes til modellen.
|
||||
|
|
|
|||
|
|
@ -4,9 +4,22 @@
|
|||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
**Source:** https://learn.microsoft.com/azure/foundry/openai/concepts/provisioned-throughput
|
||||
**Type:** reference
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter / Nøkkelegenskaper](#kjernekomponenter--nøkkelegenskaper)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Valget mellom Provisioned Throughput Units (PTU) og Pay-as-You-Go (PayGo) for Azure OpenAI-deployments er en kritisk arkitektur- og økonomibeslutning som påvirker både kostnader, ytelse og operasjonell kompleksitet. PTU tilbyr forutsigbar kapasitet og kostnader mot en timebasert commitment, mens PayGo gir fleksibilitet med token-basert fakturering. Begge modellene har sine optimale bruksområder, og feilvalg kan raskt føre til enten overforbruk eller underutnyttelse av ressurser.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-19
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/foundry-classic/openai/concepts/use-your-data
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter](#kjernekomponenter)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Retrieval Augmented Generation (RAG) representerer en av de mest kostnadsintensive delene av AI-applikasjoner i produksjon. Mens utvikling og testing av RAG-løsninger kan virke rimelig, eskalerer kostnadene raskt når systemet møter produksjonsvolumer med hundrevis eller tusenvis av queries daglig. Hver query utløser en pipeline med minimum to LLM-kall (intent generation og response generation), embedding-operasjoner, search-queries mot Azure AI Search, og potensielt semantic ranking. For organisasjoner som bygger chat-løsninger eller copilots på Microsoft-stakken, er query-kostnader ofte den største driftskostnaden.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/machine-learning/concept-endpoints-batch
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter](#kjernekomponenter)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-Stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig Sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og Lisensiering](#kostnad-og-lisensiering)
|
||||
- [For Arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og Verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Request batching og response aggregation er kritiske kostnadsoptimaliseringsteknikker for AI-løsninger som gjør det mulig å konsolidere flere API-forespørsler i én enkelt nettverksoperasjon. I stedet for å sende hundrevis eller tusenvis av individuelle API-kall, kan applikasjoner samle disse i batches, redusere nettverkslatens, minimere API throttling-risiko og drastisk kutte kostnader.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/foundry/openai/concepts/provisioned-throughput-billing
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter / Nøkkelegenskaper](#kjernekomponenter--nøkkelegenskaper)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Reserved capacity og commitment tier pricing er Azures to primære mekanismer for kostnadsoptimalisering av AI-tjenester gjennom term-baserte rabatter. Disse mekanismene lar organisasjoner oppnå betydelige kostnadsbesparelser (opptil 40-60% for reservasjoner) i bytte mot å binde seg til en bestemt kapasitet over tid.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-19
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/api-management/genai-gateway-capabilities
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter](#kjernekomponenter)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Semantic caching er en teknikk som reduserer kostnader og latens for LLM-baserte applikasjoner ved å cache og gjenbruke svar basert på semantisk likhet mellom prompts — ikke kun eksakte tekstmatch. Dette er spesielt verdifullt i AI-workloads der samme eller lignende spørsmål stilles flere ganger.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/foundry/foundry-models/concepts/models-sold-directly-by-azure
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter / Nøkkelegenskaper](#kjernekomponenter--nøkkelegenskaper)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Small Language Models (SLMs) representerer en fundamental endring i hvordan organisasjoner kan tilnærme seg AI-økonomisering. I motsetning til Large Language Models (LLMs) som GPT-4, som typisk har over 10 milliarder parametere, opererer SLMs med under 10 milliarder parametere — noe som gir dramatiske kostnadsbesparelser uten å ofre ytelse for veldefinerte oppgaver.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/foundry/concepts/manage-costs
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter](#kjernekomponenter)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Token counting og optimization er fundamentale teknikker for å kontrollere kostnader i Azure OpenAI og andre LLM-baserte løsninger. Siden fakturering baserer seg på antall tokens (både input og output), er presis måling og aktiv reduksjon av token-forbruk kritisk for økonomisk bærekraft — spesielt i høyvolum-scenarier.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-19
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/foundry/concepts/manage-costs
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter](#kjernekomponenter)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Vector storage og embeddings utgjør ofte den største kostnadsposten i moderne RAG-løsninger (Retrieval Augmented Generation). En typisk embedding-modell genererer vektorer på 1536 dimensjoner (text-embedding-ada-002) eller opptil 3072 dimensjoner (text-embedding-3-large), der hver dimensjon lagres som et 32-bit flyttall (float32). Dette gir en råstørrelse på 6-12 KB per dokument, før man tar høyde for algoritme-overhead og indekseringsstrukturer.
|
||||
|
|
|
|||
Loading…
Add table
Add a link
Reference in a new issue