chore(ms-ai-architect): refresh KB critical-bucket — 15 files [skip-docs]
KB-currency refresh (critical priority, 2026-06-19) via /architect:kb-update. 15 critical cost/arkitektur-filer re-verifisert mot Microsoft Learn (MCP). Hovedendringer: - Azure AI Search Serverless (Preview) prismodell (rag-cost, rag-query, vector-storage, rag-enterprise-scale) - Agentic retrieval GA-split (2026-04-01 REST GA, portal preview) + Foundry IQ - AI gateway multi-provider (Anthropic v2 / Google Vertex), unified model API (preview), Foundry-integrasjon (enterprise-arch, ai-services-cost, multi-model, cost-tracking) - FOCUS-skjema + Cost Mgmt -> ADLS Gen2 -> Fabric -> Power BI pipeline (cost-management, cost-allocation) - FinOps hub AI-agent via Azure MCP / Copilot Studio (budget-forecasting) - OTel trace-based sampling for logs (observability) - Korreksjoner: semantic-cache score-threshold = AVSTAND (0.15, ikke 0.85 cosine-likhet); llm-emit-token-metric maks 5 custom dimensions; Foundry RBAC-renames (Owner/Contributor = kun mgmt); Researcher/Analyst er ikke agenter - Alle 15 Last updated -> 2026-06-19 High-bucket (49 filer) UTSATT til egen sesjon (operatoer-valg). Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01REiKFhP4w6xGXXqWKpPCJJ
This commit is contained in:
parent
1ae5655156
commit
41b390b38d
15 changed files with 69 additions and 30 deletions
|
|
@ -1,6 +1,6 @@
|
|||
# Vector Storage and Embedding Cost Optimization
|
||||
|
||||
**Last updated:** 2026-05
|
||||
**Last updated:** 2026-06-19
|
||||
**Status:** GA
|
||||
**Category:** Cost Optimization & FinOps for AI
|
||||
|
||||
|
|
@ -403,6 +403,8 @@ Eksempel: 5 millioner dokumenter, gjennomsnittlig 2000 tokens per dokument
|
|||
|
||||
**Viktig:** Eldre services (pre-April 2024) har lavere quotas. Sjekk oppgraderingsmulighet: `az search service show --name <service> --resource-group <rg>`.
|
||||
|
||||
**Serverless (Preview, MCP 2026-06):** Azure AI Search tilbyr nå også en **Serverless**-prismodell (forbruksbasert: Compute Units/time + per-GB/mnd lagring) ved siden av Dedicated-tierne over. For store, men sporadisk aksesserte vektor-indekser kan Serverless redusere idle-kost. Per juni 2026 er den i preview (West Central US, Switzerland North, Japan East), uten SLA, mangler enkelte features (index aliases, debug sessions, shared private link), og støtter ikke migrering til/fra Dedicated.
|
||||
|
||||
### Embedding-kostnader (Azure OpenAI)
|
||||
|
||||
| Modell | Input (per 1M tokens) | Use case |
|
||||
|
|
|
|||
Loading…
Add table
Add a link
Reference in a new issue