chore(ms-ai-architect): refresh KB critical-bucket — 15 files [skip-docs]
KB-currency refresh (critical priority, 2026-06-19) via /architect:kb-update. 15 critical cost/arkitektur-filer re-verifisert mot Microsoft Learn (MCP). Hovedendringer: - Azure AI Search Serverless (Preview) prismodell (rag-cost, rag-query, vector-storage, rag-enterprise-scale) - Agentic retrieval GA-split (2026-04-01 REST GA, portal preview) + Foundry IQ - AI gateway multi-provider (Anthropic v2 / Google Vertex), unified model API (preview), Foundry-integrasjon (enterprise-arch, ai-services-cost, multi-model, cost-tracking) - FOCUS-skjema + Cost Mgmt -> ADLS Gen2 -> Fabric -> Power BI pipeline (cost-management, cost-allocation) - FinOps hub AI-agent via Azure MCP / Copilot Studio (budget-forecasting) - OTel trace-based sampling for logs (observability) - Korreksjoner: semantic-cache score-threshold = AVSTAND (0.15, ikke 0.85 cosine-likhet); llm-emit-token-metric maks 5 custom dimensions; Foundry RBAC-renames (Owner/Contributor = kun mgmt); Researcher/Analyst er ikke agenter - Alle 15 Last updated -> 2026-06-19 High-bucket (49 filer) UTSATT til egen sesjon (operatoer-valg). Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01REiKFhP4w6xGXXqWKpPCJJ
This commit is contained in:
parent
1ae5655156
commit
41b390b38d
15 changed files with 69 additions and 30 deletions
|
|
@ -1,6 +1,6 @@
|
|||
# Azure AI Foundry Cost Governance and Controls
|
||||
|
||||
**Last updated:** 2026-02
|
||||
**Last updated:** 2026-06-19
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
|
||||
|
|
@ -102,6 +102,14 @@ Dynamic quota lar deployments opportunistisk bruke ubrukt kapasitet utover sin b
|
|||
- ❌ Produksjonsapplikasjoner som krever forutsigbar ytelse
|
||||
- ❌ Når du må enforce hard spending cap (dynamic quota har ingen takgrense)
|
||||
|
||||
### 6. Resource-modell og RBAC (MCP 2026-06)
|
||||
|
||||
**«Foundry Tools» → «Foundry resource»:** Den underliggende Azure-ressursen (API-kind `AIServices`) er omdøpt til **Microsoft Foundry resource** — neste versjon og renaming av tidligere «Foundry Tools». Projects fungerer som mapper for å gruppere arbeid under én ressurs (relevant for kostnadsallokering per prosjekt).
|
||||
|
||||
**Foundry RBAC-roller (omdøpt — rolle-IDer og kjernepermisjoner uendret):** Azure AI User → **Foundry User**, Azure AI Owner → **Foundry Owner**, Azure AI Account Owner → **Foundry Account Owner**, Azure AI Project Manager → **Foundry Project Manager**. De gamle navnene kan fortsatt vises mens utrullingen pågår.
|
||||
|
||||
**Viktig for rolleseparering / least-privilege:** Azure **Owner** og **Contributor** gir KUN management-tilgang (opprette/konfigurere ressurser, styre kvote/kostnad) — **ikke** utviklingstilgang. For å faktisk bygge (data actions) kreves **Foundry User** (minste privilegium for utviklere) eller **Foundry Owner**. Dette gir et rent skille mellom hvem som styrer kostnad/kvote og hvem som utvikler — direkte nyttig for IKS-rolleseparering omtalt lenger ned.
|
||||
|
||||
## Arkitekturmønstre
|
||||
|
||||
### Mønster 1: Strict Quota Governance (High Control)
|
||||
|
|
|
|||
|
|
@ -1,6 +1,6 @@
|
|||
# Azure Cost Management and Budget Monitoring for AI
|
||||
|
||||
**Last updated:** 2026-02
|
||||
**Last updated:** 2026-06-19
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
|
||||
|
|
@ -131,6 +131,8 @@ Plattformen er gratis for alle Azure-kunder og integreres sømløst med Azure Po
|
|||
- **FinOps Hub**: Open-source accelerator fra Microsoft (Data Factory + Fabric) for advanced analytics
|
||||
- **Azure Data Explorer (ADX)**: Query cost data med KQL for AI-powered insights (Copilot integration)
|
||||
|
||||
**FOCUS + moderne eksport-pipeline (MCP 2026-06):** Microsoft anbefaler nå **FOCUS** (FinOps Open Cost and Usage Specification) — et leverandør-agnostisk skjema — som eksport-template i Cost Management. Den skalerbare analyse-pipelinen er **Cost Management exports → ADLS Gen2 → Fabric Lakehouse → Power BI** (FOCUS-formatert, daglig schedule). For høyvolum-loggkostnader: bruk ingestion-time transformation i Azure Monitor for å filtrere før lagring. Cost Management beholder data i 13 måneder; eksporter til storage (cool/archive) for lengre historikk.
|
||||
|
||||
### Azure Monitor & Log Analytics
|
||||
|
||||
- **Activity Log**: Spor budsjett-opprettelse, endringer, alert-triggering
|
||||
|
|
|
|||
|
|
@ -1,6 +1,6 @@
|
|||
# Budget Forecasting and Financial Planning for AI
|
||||
|
||||
**Last updated:** 2026-02
|
||||
**Last updated:** 2026-06-19
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
|
||||
|
|
@ -334,6 +334,8 @@ CostDetails
|
|||
| where Anomaly > 1.5
|
||||
```
|
||||
|
||||
**AI-agent over FinOps hubs (MCP 2026-06):** Du kan nå koble en AI-agent direkte til FinOps hub-databasen via **Azure MCP server** og stille naturlig-språk-spørsmål om allokering, forecasting, anomalier og rate-optimering — enten i **GitHub Copilot (Agent mode i VS Code)** med ferdige FinOps-instruksjoner, eller som en **Copilot Studio-agent** publisert til Teams/M365 Copilot. Agenten forstår FinOps + **FOCUS**-skjemaet (andre MCP-klienter som Claude kan også brukes). Eksempel: «Show me the cost for last month, this month, and the forecasted cost by end of month for the top subscriptions.»
|
||||
|
||||
**Verified** — FinOps Hubs Documentation
|
||||
|
||||
---
|
||||
|
|
|
|||
|
|
@ -1,6 +1,6 @@
|
|||
# Cost Allocation and Chargeback Models
|
||||
|
||||
**Last updated:** 2026-04
|
||||
**Last updated:** 2026-06-19
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
|
||||
|
|
@ -168,6 +168,8 @@ Tags er key-value pairs som kan brukes til å kategorisere ressurser og kostnade
|
|||
- Usage Details API støtter **ikke** cost allocation (bruk Cost Details API i stedet)
|
||||
- Reservasjoner og Savings Plans støttes **ikke** for allocation
|
||||
|
||||
**FOCUS-skjema (MCP 2026-06):** For standardiserte, leverandør-agnostiske eksporter anbefaler Microsoft nå **FOCUS** (FinOps Open Cost and Usage Specification) som eksport-template i Cost Management — nyttig for konsistent chargeback-/showback-rapportering på tvers av verktøy og skyer. Pipeline: Cost Management exports → ADLS Gen2 → Fabric Lakehouse → Power BI.
|
||||
|
||||
### Management Groups og Subscriptions
|
||||
|
||||
**Strategi:**
|
||||
|
|
|
|||
|
|
@ -1,6 +1,6 @@
|
|||
# Multi-Model Strategy: Cost-Performance Trade-offs
|
||||
|
||||
**Last updated:** 2026-05 | Verified: MCP 2026-05
|
||||
**Last updated:** 2026-06-19 | Verified: MCP 2026-06
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
|
||||
|
|
@ -51,6 +51,8 @@ For organisasjoner som ønsker mer kontroll, tilbyr custom gateway-løsninger (v
|
|||
- **Azure API Management:** PaaS-løsning med backend pools, circuit breaker, policy-basert routing
|
||||
- **Custom Code:** Full kontroll, typisk Azure Container Apps eller AKS, frontet av Azure Front Door/Traffic Manager
|
||||
|
||||
**Multi-provider gateway (MCP 2026-06):** Azure API Managements AI gateway medierer nå også ikke-OpenAI-skjemaer — **Anthropic Messages API** (v2-tiers) og **Google Vertex AI** — i tillegg til Foundry-modeller, og tilbyr **unified model API (preview)**: ett OpenAI-kompatibelt endepunkt på tvers av leverandører med felles policy-governance. Relevant for multi-model-strategier som spenner over flere modell-leverandører, ikke bare flere Azure OpenAI-deployments.
|
||||
|
||||
## Arkitekturmønstre
|
||||
|
||||
### 1. Model Router: Managed Multi-Model Routing
|
||||
|
|
|
|||
|
|
@ -1,6 +1,6 @@
|
|||
# Observability and Monitoring Cost Optimization
|
||||
|
||||
**Last updated:** 2026-05 | Verified: MCP 2026-05
|
||||
**Last updated:** 2026-06-19 | Verified: MCP 2026-06
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
|
||||
|
|
@ -47,6 +47,8 @@ Moderne Azure Monitor tilbyr flere kostnadseffektive alternativer som Basic Logs
|
|||
|
||||
**Viktig:** Metrics samples aldri. Sampling påvirker kun traces (spans) og optionally logs. Alerts basert på metrics forblir nøyaktige.
|
||||
|
||||
**OpenTelemetry-distro (MCP 2026-06):** Azure Monitor OTel-distroen har **ikke** sampling på som default og bruker to strategier: **fixed-rate** (ratio 0–1, f.eks. `0.1` = ~10 %) og **rate-limited** (traces/sek, f.eks. `5.0` = fem traces/sek). En egen **trace-based sampling for logs** dropper logger knyttet til ikke-samplede traces og er **på som default når sampling er aktivert** (støttede språk) — gir kostnadsreduksjon utover trace-sampling alene. Distroens custom sampler bevarer hele traces (unngår broken traces) og kreves for Live Metrics. Anbefalt logg-strategi: eksporter kun `ERROR` (legg til `WARN` kun når handlingsrettet).
|
||||
|
||||
## Arkitekturmønstre
|
||||
|
||||
### Mønster 1: Full Observability (Production-Grade AI)
|
||||
|
|
|
|||
|
|
@ -1,6 +1,6 @@
|
|||
# RAG Query Cost Optimization
|
||||
|
||||
**Last updated:** 2026-04
|
||||
**Last updated:** 2026-06-19
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
|
||||
|
|
@ -53,6 +53,8 @@ Basert på Microsoft Learn-data for standard konfigurasjon (5 retrieved document
|
|||
|
||||
**Baseline (Modellkunnskap):** Prisene er omregnet fra USD til NOK (1 USD ≈ 11 NOK, februar 2026) og er veiledende.
|
||||
|
||||
**NY prismodell — Serverless (Preview, MCP 2026-06):** Azure AI Search tilbyr nå to prismodeller: **Dedicated** (provisioned, fast pris per Search Unit — tabellen over) og **Serverless (Preview)** — forbruksbasert (Compute Units/time + per-GB/mnd lagring), ingen compute-kost ved idle. Best for sporadiske/variable workloads; en kontinuerlig provisjonert Basic/S1 kan være dyrere enn Serverless ved bursty trafikk. Per juni 2026 er Serverless i preview (kun West Central US, Switzerland North, Japan East), støtter ikke migrering til/fra dedicated, og er ikke anbefalt for produksjon ennå.
|
||||
|
||||
### Semantic Ranking Costs
|
||||
|
||||
**Verified (Microsoft Learn):** Semantic ranking er en premium-funksjon som påløper ekstra kostnader per query. Kostnaden er progressiv og varierer basert på volum:
|
||||
|
|
@ -142,13 +144,14 @@ else: # Complex reasoning
|
|||
|
||||
### 4. Agentic Retrieval (Cost-Aware)
|
||||
|
||||
**Status: Public Preview** — Agentic Retrieval er foreløpig i public preview (ikke GA). *(Verified MCP 2026-04)*
|
||||
**Status: GA-split (MCP 2026-06)** — Deler av agentic retrieval er **generelt tilgjengelig i `2026-04-01` REST API** (programmatisk tilgang). Azure-portalen og Microsoft Foundry-portalen gir fortsatt **kun preview-tilgang** til alle agentic retrieval-funksjoner. Pipelinen er også kunnskapslaget bak **Foundry IQ** i Foundry-portalen. *(Verified MCP 2026-06)*
|
||||
|
||||
**Prinsipp:** Azure AI Search Agentic Retrieval bruker LLM til å generere subqueries som kjøres parallelt. Dette kan være dyrt, men også mer effektivt enn multiple sequential queries.
|
||||
**Prinsipp:** Azure AI Search Agentic Retrieval bruker LLM til å generere fokuserte subqueries som kjøres parallelt, hver semantisk rerangert. Dette kan være dyrt, men også mer effektivt enn multiple sekvensielle queries.
|
||||
|
||||
**Prismodell (public preview):**
|
||||
- **Free tier:** 50 millioner gratis agentic reasoning tokens/måned inkludert (på Basic tier og høyere)
|
||||
- **Standard tier:** Pay-as-you-go etter at gratis kvota er brukt
|
||||
**Prismodell:**
|
||||
- **Free plan (default):** månedlig gratis token-kvote inkludert (eksakt mengde oppgis ikke lenger i dokumentasjonen — se [Azure AI Search pricing](https://azure.microsoft.com/pricing/details/search))
|
||||
- **Standard plan:** pay-as-you-go etter at gratis kvota er brukt
|
||||
- **Azure OpenAI faktureres separat** (alltid pay-as-you-go) for input/output-tokens i query planning + answer synthesis
|
||||
|
||||
**Kostnadseksempel (Verified - Microsoft Learn):**
|
||||
- **2000 agentic retrievals** med 3 subqueries per plan:
|
||||
|
|
|
|||
|
|
@ -1,6 +1,6 @@
|
|||
# Semantic Caching for AI Workloads
|
||||
|
||||
**Last updated:** 2026-02
|
||||
**Last updated:** 2026-06-19
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
|
||||
|
|
@ -65,6 +65,8 @@ Semantic caching består av fire hovedkomponenter:
|
|||
- `0.70-0.84`: Liberal matching, høyere cache hit rate men lavere presisjon
|
||||
- **Start med 0.85 og juster basert på cache hit rate og user feedback** (MEDIUM confidence)
|
||||
|
||||
**Viktig — `score-threshold` i APIM-policyen er en AVSTAND, ikke cosine-likhet (MCP 2026-06):** Tabellen over gjelder generell cosine-**likhet** (høyere = strengere), som brukes av application-level vector-stores. Men APIM-policyene `llm-semantic-cache-lookup` / `azure-openai-semantic-cache-lookup` bruker et `score-threshold` som er en semantisk **avstand**: prompts med score *over* terskelen bruker IKKE cachen, så **lavere terskel = strengere matching**. Microsofts eget eksempel bruker `score-threshold="0.15"`. Sett derfor en LAV verdi (~0.1–0.2) i APIM-policyene under — IKKE 0.85.
|
||||
|
||||
---
|
||||
|
||||
## Arkitekturmønstre
|
||||
|
|
@ -88,7 +90,7 @@ Client → APIM (semantic cache policies) → Azure Managed Redis (RediSearch)
|
|||
```xml
|
||||
<!-- Inbound: Cache Lookup -->
|
||||
<azure-openai-semantic-cache-lookup
|
||||
score-threshold="0.85"
|
||||
score-threshold="0.15"
|
||||
embeddings-backend-id="embeddings-backend"
|
||||
embeddings-backend-auth="system-assigned"
|
||||
ignore-system-messages="true"
|
||||
|
|
@ -313,7 +315,7 @@ L3: Azure OpenAI → 500-2000ms latency
|
|||
|
||||
| Parameter | Verdi | Forklaring |
|
||||
|-----------|-------|------------|
|
||||
| `score-threshold` | 0.85 (anbefalt) | Minimum similarity for cache hit (0-1) |
|
||||
| `score-threshold` | 0.15 (lav!) | Semantisk **avstand**-terskel: prompts over terskelen bruker IKKE cachen → **lavere = strengere**. IKKE cosine-likhet. MS-eksempel: 0.15 |
|
||||
| `embeddings-backend-id` | "embeddings-backend" | Backend ID for embeddings deployment |
|
||||
| `embeddings-backend-auth` | "system-assigned" | Bruker APIM managed identity |
|
||||
| `ignore-system-messages` | true | Ignorer system messages i similarity-beregning |
|
||||
|
|
@ -398,7 +400,7 @@ Azure AI Foundry models (via Model Inference API) støttes med generic LLM polic
|
|||
```xml
|
||||
<!-- Use llm-semantic-cache-lookup instead of azure-openai-semantic-cache-lookup -->
|
||||
<llm-semantic-cache-lookup
|
||||
score-threshold="0.85"
|
||||
score-threshold="0.15"
|
||||
embeddings-backend-id="embeddings-backend"
|
||||
embeddings-backend-auth="system-assigned">
|
||||
<vary-by>@(context.Subscription.Id)</vary-by>
|
||||
|
|
|
|||
|
|
@ -1,6 +1,6 @@
|
|||
# Vector Storage and Embedding Cost Optimization
|
||||
|
||||
**Last updated:** 2026-05
|
||||
**Last updated:** 2026-06-19
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
|
||||
|
|
@ -403,6 +403,8 @@ Eksempel: 5 millioner dokumenter, gjennomsnittlig 2000 tokens per dokument
|
|||
|
||||
**Viktig:** Eldre services (pre-April 2024) har lavere quotas. Sjekk oppgraderingsmulighet: `az search service show --name <service> --resource-group <rg>`.
|
||||
|
||||
**Serverless (Preview, MCP 2026-06):** Azure AI Search tilbyr nå også en **Serverless**-prismodell (forbruksbasert: Compute Units/time + per-GB/mnd lagring) ved siden av Dedicated-tierne over. For store, men sporadisk aksesserte vektor-indekser kan Serverless redusere idle-kost. Per juni 2026 er den i preview (West Central US, Switzerland North, Japan East), uten SLA, mangler enkelte features (index aliases, debug sessions, shared private link), og støtter ikke migrering til/fra Dedicated.
|
||||
|
||||
### Embedding-kostnader (Azure OpenAI)
|
||||
|
||||
| Modell | Input (per 1M tokens) | Use case |
|
||||
|
|
|
|||
Loading…
Add table
Add a link
Reference in a new issue