docs(ms-ai-architect): KB-refresh critical cost 5/8 — prompt-engineering verifisert mot prompt-caching + On Your Data-retirement

Verifisert mot live Microsoft Learn (foundry/openai/how-to/prompt-caching,
foundry-classic/openai/concepts/use-your-data, ai-foundry/openai/concepts/model-retirements):
- Extended cache retention 24t BEKREFTET: «keeps cached prefixes active for longer, up to a maximum
  of 24 hours», param prompt_cache_retention='24h'. Model-gated: gpt-5/5.1/5.2/5.4 (+codex/chat) +
  gpt-4.1 (BEVISST utelatt gpt-5.5 — IKKE i extended-listen). Default 24h for nyere modeller
  (in_memory ikke støttet); gpt-5.4 og eldre: in_memory default. Filens «5-10 min/maks 1t» var kun
  in-memory-delen → cache-tabell splittet i in-memory vs extended + støttemodell-lister korrigert.
- On Your Data BEKREFTET deprecated, retires «October 14, 2026» → kilde #5 flagget m/ migrasjonspeker
  (Foundry Agent Service + Foundry IQ).
- prompt_cache_key-nyanse lagt til (~15 req/min overflow-grense, fra docs).

Korreksjons-disiplin (operatør-godkjent):
- Data-residens-nyanse (HØYVERDI for offentlig sektor): extended-cache holdes i-region KUN ved
  Regional Standard/Provisioned; Global/DataZone kan forlate region. Rettet GDPR- + Datasuverenitet-bullets
  (gammel «clears etter maks 1 time» + «lagres i samme region» var nå feil for extended).
- Pristabell: o1-preview (retired 2025-07) + GPT-4/32K (retired 2025-06) flagget retired m/ peker til
  kanonisk pricing (model-retirements-tabellen). Prompt Flow «GPT-3.5» → gjeldende modeller.
- Header 2026-02→2026-06, footer 2026-02-04→2026-06. 3 kilde-rader stemplet Verified MCP 2026-06. validate 239/0.

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
This commit is contained in:
Kjell Tore Guttormsen 2026-06-23 22:49:46 +02:00
commit c1e5a22825

View file

@ -1,6 +1,6 @@
# Prompt Engineering for Cost Reduction
**Last updated:** 2026-02
**Last updated:** 2026-06
**Status:** GA
**Category:** Cost Optimization & FinOps for AI
@ -36,11 +36,16 @@ Prompt caching er en kraftig funksjon for kostnadsreduksjon når du har repetere
|---------|----------|
| **Minimumskrav** | 1024 tokens i lengde, første 1024 må være identiske |
| **Cache granularitet** | Cache hits etter første 1024 tokens: hver 128 tokens |
| **Cache varighet** | 5-10 minutter inaktivitet, maks 1 time |
| **Prisreduksjon** | 50% rabatt (Standard), opptil 100% (Provisioned) |
| **Støttede modeller** | GPT-4o, GPT-4o-mini, o1-serien, GPT-4.1-serien, o3-mini |
| **Cache varighet (in-memory)** | Tømmes typisk etter 5-10 min inaktivitet, alltid innen 1 time |
| **Cache varighet (extended)** | `prompt_cache_retention: "24h"` — holder cachede prefixer aktive i opptil 24 timer |
| **Prisreduksjon** | Rabatt på input-tokens (Standard, typisk 50%), opptil 100% (Provisioned) — samme pris for begge retention-policyer |
| **Støttede modeller (in-memory)** | Alle Azure OpenAI-modeller GPT-4o eller nyere |
| **Støttede modeller (extended 24h)** | gpt-5, gpt-5.1, gpt-5.2, gpt-5.4 (+ codex-/chat-varianter) og gpt-4.1 |
| **Default retention** | gpt-5.4 og eldre: `in_memory` (24h valgbar). Nyere modeller: `24h` (in_memory ikke støttet) |
**Verified (MCP):** [Microsoft Foundry - Prompt Caching](https://learn.microsoft.com/en-us/azure/foundry/openai/how-to/prompt-caching)
**Verified MCP 2026-06:** [Microsoft Foundry - Prompt Caching](https://learn.microsoft.com/en-us/azure/foundry/openai/how-to/prompt-caching)
**`prompt_cache_key`:** Sett denne for å påvirke routing og øke cache-hit-rate når mange requests deler lang felles prefix. NB: overstiger samme prefix + `prompt_cache_key` ~15 requests/min, overflows noen requests til ekstra maskiner og cache-effektiviteten faller.
### Token-effektivitet per dataformat
@ -228,17 +233,19 @@ Bruk Prompt Flow for A/B-testing av prompt-varianter:
| **Token tracking** | Automatisk logging av token usage per variant |
| **Evaluation metrics** | Kombiner kvalitet (relevance, groundedness) med kostnad |
**Baseline:** Prompt Flow støtter GPT-3.5 og GPT-4-serien. GPT-4 gir bedre resultater, men test kostnad vs. kvalitet.
**Baseline:** Prompt Flow støtter gjeldende modeller (GPT-4.1- og GPT-5-serien m.fl.). Større modeller gir ofte bedre resultater, men test kostnad vs. kvalitet.
### AI Foundry
AI Foundry Model Catalog støtter prompt caching for:
- GPT-4o (2024-11-20, 2024-08-06)
- GPT-4o-mini (2024-07-18)
AI Foundry Model Catalog støtter prompt caching (in-memory) for alle Azure OpenAI-modeller GPT-4o eller nyere, inkludert:
- GPT-4o (2024-11-20, 2024-08-06), GPT-4o-mini (2024-07-18)
- o1-serien og o3-mini
- GPT-4.1-serien
- GPT-5-serien (gpt-5/5.1/5.2/5.4 + codex-varianter)
**Verified (MCP):** [AI Foundry Models - Prompt Caching](https://learn.microsoft.com/en-us/azure/foundry/openai/how-to/prompt-caching)
Extended 24h-retention (`prompt_cache_retention: "24h"`) er tilgjengelig for GPT-5-serien + GPT-4.1; for nyere modeller er `24h` default.
**Verified MCP 2026-06:** [AI Foundry Models - Prompt Caching](https://learn.microsoft.com/en-us/azure/foundry/openai/how-to/prompt-caching)
### Copilot Studio
@ -262,13 +269,13 @@ Copilot Studio bruker underliggende Azure OpenAI, men:
### GDPR og AI Act
- Prompt caching deler ikke data mellom subscriptions (GDPR-compliant)
- Cache clears etter maks 1 time (data minimization)
- In-memory-cache tømmes innen 1 time; extended retention (`24h`) holder data i opptil 24 timer — vurder data-minimering-implikasjonen ved valg av retention-policy
- Ingen PII i cached prompts (design principle)
### Datasuverenitet
- Prompt caches lagres i samme Azure-region som deployment
- Norske organisasjoner: Bruk Norway East eller West Europe
- In-memory-caching er kompatibel med alle data-residency-regioner. Extended retention lagrer data midlertidig på GPU-maskiner og holder data **i-region kun** ved deployment-typene Regional Standard / Regional Provisioned — ved Global-/DataZone-typer kan extended-cache-data forlate regionen
- Norske organisasjoner med residens-krav: bruk Norway East / West Europe, og velg Regional-deployment hvis extended retention skal holdes i-region
---
@ -280,10 +287,12 @@ Copilot Studio bruker underliggende Azure OpenAI, men:
|--------|----------------------|------------------------|---------------------|
| GPT-4o | $2.50 | $10.00 | 50% (Standard) |
| GPT-4o-mini | $0.15 | $0.60 | 50% (Standard) |
| o1-preview | $15.00 | $60.00 | 50% (Standard) |
| GPT-4 (32K) | $60.00 | $120.00 | Ikke støttet |
| o1-preview *(retired 2025-07)* | $15.00 | $60.00 | 50% (Standard) |
| GPT-4 / GPT-4-32K *(retired 2025-06)* | $60.00 | $120.00 | Ikke støttet |
**Verified (MCP):** [Azure OpenAI Pricing](https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/)
*Merk: o1-preview og GPT-4/GPT-4-32K er retired (kan ikke lenger deployes) — radene står som historisk referanse. For nye løsninger, bruk gjeldende modeller (GPT-5-serien, o3, GPT-4.1). Azure OpenAI Pricing-siden er kanonisk kilde for gjeldende satser.*
**Verified MCP 2026-06:** [Azure OpenAI Pricing](https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/)
### Besparelsespotensiale (eksempel)
@ -369,11 +378,11 @@ Copilot Studio bruker underliggende Azure OpenAI, men:
### Microsoft Learn (Verified via MCP)
1. [Prompt Caching - Microsoft Foundry](https://learn.microsoft.com/en-us/azure/foundry/openai/how-to/prompt-caching) **Verified**
1. [Prompt Caching - Microsoft Foundry](https://learn.microsoft.com/en-us/azure/foundry/openai/how-to/prompt-caching) **Verified MCP 2026-06** (in-memory + extended 24h retention)
2. [Prompt Engineering Techniques](https://learn.microsoft.com/en-us/azure/foundry/openai/concepts/prompt-engineering) **Verified**
3. [Azure OpenAI Pricing](https://azure.microsoft.com/pricing/details/cognitive-services/openai-service/) **Verified**
4. [Manage Costs for Azure OpenAI](https://learn.microsoft.com/en-us/azure/foundry/concepts/manage-costs) **Verified**
5. [Token Usage Estimation](https://learn.microsoft.com/en-us/azure/foundry-classic/openai/concepts/use-your-data#token-usage-estimation-for-azure-openai-on-your-data) **Verified**
5. [Token Usage Estimation Azure OpenAI On Your Data (classic)](https://learn.microsoft.com/en-us/azure/foundry-classic/openai/concepts/use-your-data#token-usage-estimation-for-azure-openai-on-your-data) **Verified MCP 2026-06** ⚠️ *On Your Data er deprecated og pensjoneres **2026-10-14**; migrer til Foundry Agent Service + Foundry IQ. Token-estimat-metodikken er fortsatt illustrativ.*
### Konfidensnivå per seksjon
@ -388,6 +397,6 @@ Copilot Studio bruker underliggende Azure OpenAI, men:
---
**Sist oppdatert:** 2026-02-04
**Sist oppdatert:** 2026-06
**Forfatter:** Cosmo Skyberg, Microsoft AI Solution Architect
**Review status:** Ready for production