refactor(ms-ai-architect): R13 del 1 — nøytraliser Cosmo-personaen i ref-korpusets headinger, etter å ha rettet en gate som var målt usann to ganger
Ordre 20260912T193441Z-7358817909. Steg 1 var ikke transformen, men å rette
roadmapens R13-gate og få den ratifisert. Gaten `grep -rl "Cosmo"
skills/*/references -> 0` var usann på to uavhengige måter:
1. Ordren fanget den første: 451 av forekomstene er Azure Cosmos DB, ekte
produktinnhold. Diskriminatoren er ikke bokstaven «s» — `Cosmos <norsk
substantiv>` er genitiv av personaen (`### Cosmos tonalitet`), mens
`Cosmos DB`/`CosmosClient`/`cosmos_ru` er produkt.
2. Denne økten fant den andre: 132 persona-forekomster ligger i prosa,
tabeller, dialog-replikker og proveniens-linjer. Heading-nøytralisering
kan ikke nå dem, så «0 persona» er uoppnåelig også under den ratifiserte
formen. Operatøren ratifiserte alternativ A: gaten speiler formen, og de
132 bokføres til R13b/R14.
Tre korreksjoner av premisser som sto i ordren og STATE:
«ca 320 produkt» -> 451 (case-sensitivt nett manglet 327 lowercase
TOC-ankre + 99 identifikatorer; sann nevner 1 638)
«169 headinger» -> 401. 169 var `^## For Cosmo`-prefikset (168) og var
internt inkonsistent med sin egen topp-variant (204)
«417 matcher ingen
populasjon» -> 417 er cosmo-headinger utenfor kodefences; briefens
nevner var reell hele tiden
Fence-bevissthet er målt skadelig, ikke nødvendig: begge toggle-regler er
gale på dette korpuset (naiv toggle skjuler en ekte heading i
chain-of-thought-prompting.md, CommonMark-regelen ubalanserer
service-level-documentation-dr.md). Fence-agnostisk deteksjon finner 401
heading-linjer i nøyaktig de samme 40 variantene som fence-bevisst finner
400 i — ingen kodeblokk-linje er byte-identisk til en persona-heading. Derfor
nøkles transformen på 40 enumererte heading-tekster og ignorerer fences. En
ukjent variant kaster; en slug-kollisjon kaster. Ingenting auto-fikses.
TOC-en regenereres ikke, den rettes kirurgisk: alle 327 persona-lenker hadde
lenketekst lik én av de 40 heading-tekstene og anker lik slugify av den
(327/327, 0 avvik), så heading og TOC-entry skrives i samme operasjon og
ingen mellomtilstand etterlater en død lenke.
Ratifisert målform: `For Cosmo`, `For Cosmo Skyberg` og `For arkitekten
(Cosmo)` konvergerer på `For arkitekten`. To filer kolliderte og er adjudisert
ved å lese dem, ikke ved regel.
Verifisering (alle 7 kriterier fra ordren):
G1 persona på heading-linjer 401 -> 0
G2 døde fragmentlenker 1 -> 1 (pre-eksisterende, unntatt)
G3 produkt-forekomster 451 -> 451; `Cosmos DB|Azure Cosmos` 308 = 308
de 3 kun-produkt-filene byte-identiske
nettet validert begge veier injisert persona feller G1; genitiv feller G1;
produkt-heading og de 3 filene passerer
hele diffen 802 heading-linjer + 654 TOC-linjer, ANNET = 0
linjeantall 728 lagt til = 728 slettet
suite 1120/1120 (1097 + 23 nye)
validate-plugin 250 PASS / 0 FAIL
stikkprøve 10 filer, alle 5 skills, inkl. de 3 mest
produkt-tunge (26/20/19) — kun heading+TOC
Utenfor scope, urørt: de 4 SKILL.md, de 23 commands, CLAUDE.md, README.md,
NOTICE.md, docs/ (alt R14).
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
parent
7655f1798e
commit
3a73eeafdc
380 changed files with 1711 additions and 729 deletions
|
|
@ -22,7 +22,7 @@
|
|||
- [Norsk offentlig sektor](#norsk-offentlig-sektor)
|
||||
- [Beslutningsrammeverk](#beslutningsrammeverk)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
- [For arkitekten](#for-arkitekten)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
|
|
@ -551,7 +551,7 @@ def publish_ordered_event(
|
|||
- [Event-driven architecture style](https://learn.microsoft.com/azure/architecture/guide/architecture-styles/event-driven) — Architecture patterns
|
||||
- [Azure Functions on Container Apps](https://learn.microsoft.com/azure/container-apps/functions-unified-platform) — Event-driven compute
|
||||
|
||||
## For Cosmo
|
||||
## For arkitekten
|
||||
|
||||
- **Bruk denne referansen** når kunden har AI-workloads som ikke krever umiddelbart svar, eller når de opplever timeout-problemer med langvarige AI-forespørsler.
|
||||
- Azure OpenAI Background Tasks er den enkleste løsningen for reasoning-modeller (o3, o1) som kan ta minutter — sett `background: true`.
|
||||
|
|
|
|||
|
|
@ -19,7 +19,7 @@
|
|||
- [Azure OpenAI-spesifikk skalering](#azure-openai-spesifikk-skalering)
|
||||
- [Overvaking av skalering](#overvaking-av-skalering)
|
||||
- [Sjekkliste for auto-scaling](#sjekkliste-for-auto-scaling)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
- [For arkitekten](#for-arkitekten)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
|
|
@ -589,7 +589,7 @@ ContainerAppSystemLogs
|
|||
| 9 | Implementer graceful shutdown for lange AI-operasjoner | Medium |
|
||||
| 10 | Dokumenter skaleringslogikk i ADR | Anbefalt |
|
||||
|
||||
## For Cosmo
|
||||
## For arkitekten
|
||||
|
||||
- **Horisontal skalering er standard** for AI-arbeidslaster. Azure Container Apps med KEDA er forstevalgdet for mikrotjenester og API-lag. VM Scale Sets for GPU-tunge arbeidslaster.
|
||||
- **Kombinert schedule + reaktiv skalering** gir best resultat for offentlig sektor: forutsigbar baseline i arbeidstid, lav kapasitet pa kveld/helg, med reaktiv oppskalering for uforutsette topper.
|
||||
|
|
|
|||
|
|
@ -19,7 +19,7 @@
|
|||
- [Retry og feilhhandtering](#retry-og-feilhhandtering)
|
||||
- [Bruksomrader for norsk offentlig sektor](#bruksomrader-for-norsk-offentlig-sektor)
|
||||
- [Sjekkliste for batch-optimalisering](#sjekkliste-for-batch-optimalisering)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
- [For arkitekten](#for-arkitekten)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
|
|
@ -566,7 +566,7 @@ system_prompt = "Oversett teksten fra bokmaal til nynorsk. Bevar fagterminologi.
|
|||
| 9 | Bruk Blob Storage for filer over 200 MB | Ved behov |
|
||||
| 10 | Sett opp alerting for batch completion | Anbefalt |
|
||||
|
||||
## For Cosmo
|
||||
## For arkitekten
|
||||
|
||||
- **50% kostnadsreduksjon** gjor Batch API til forstevalgdet for all ikke-sanntids AI-prosessering i offentlig sektor. Masseklassifisering, dokumentanalyse og oversettelse bor alltid bruke batch.
|
||||
- **Datasuverenitet:** Batch API prosesserer data i enhver Azure OpenAI-region for Global Batch. Bruk DataZoneBatch for a begrense til EU-regioner, eller Regional Batch for strengeste krav.
|
||||
|
|
|
|||
|
|
@ -17,7 +17,7 @@
|
|||
- [Geografisk routing og optimalisering](#geografisk-routing-og-optimalisering)
|
||||
- [DDoS-beskyttelse for AI-endepunkter](#ddos-beskyttelse-for-ai-endepunkter)
|
||||
- [Ytelsesgevinster: Oppsummering](#ytelsesgevinster-oppsummering)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
- [For arkitekten](#for-arkitekten)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
|
|
@ -570,7 +570,7 @@ resource wafPolicy 'Microsoft.Network/FrontDoorWebApplicationFirewallPolicies@20
|
|||
| Geographic routing | 10-40 ms | Ingen direkte | Lav |
|
||||
| DDoS/rate limiting | Indirekte (beskyttelse) | Hindrer misbrukskostnader | Medium |
|
||||
|
||||
## For Cosmo
|
||||
## For arkitekten
|
||||
|
||||
- **Azure Front Door er obligatorisk** for alle publiserte AI-endepunkter. Det gir TLS-terminering, DDoS-beskyttelse, geographic routing og traffic acceleration med minimal konfigurasjon.
|
||||
- **Cache ALDRI chat completion-responser.** Feilkonfigurert caching kan lekke personopplysninger mellom brukere. Kun statisk innhold, modellmetadata og embeddings kan caches trygt.
|
||||
|
|
|
|||
|
|
@ -19,7 +19,7 @@
|
|||
- [Norsk offentlig sektor](#norsk-offentlig-sektor)
|
||||
- [Beslutningsrammeverk](#beslutningsrammeverk)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
- [For arkitekten](#for-arkitekten)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
|
|
@ -437,7 +437,7 @@ class FairScheduler:
|
|||
- [Performance and latency](https://learn.microsoft.com/azure/foundry/openai/how-to/latency) — Concurrent requests og throughput
|
||||
- [Provisioned throughput](https://learn.microsoft.com/azure/foundry/openai/how-to/provisioned-get-started) — PTU utilization
|
||||
|
||||
## For Cosmo
|
||||
## For arkitekten
|
||||
|
||||
- **Bruk denne referansen** når kunden opplever timeout, starvation eller ujevn ytelse i AI-applikasjoner med mange samtidige brukere.
|
||||
- Start konservativt (10-20 concurrent) og øk gradvis mens du monitorerer throttle rate — aldri gå rett til 100 concurrent.
|
||||
|
|
|
|||
|
|
@ -20,7 +20,7 @@
|
|||
- [Norsk offentlig sektor](#norsk-offentlig-sektor)
|
||||
- [Beslutningsrammeverk](#beslutningsrammeverk)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
- [For arkitekten](#for-arkitekten)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
|
|
@ -407,7 +407,7 @@ Connection pooling har spesielle hensyn for norsk offentlig sektor:
|
|||
- [Manage connections in Azure Functions](https://learn.microsoft.com/azure/azure-functions/manage-connections) — Serverless connection management
|
||||
- [Use a gateway in front of multiple Azure OpenAI deployments or instances](https://learn.microsoft.com/azure/architecture/ai-ml/guide/azure-openai-gateway-multi-backend) — Multi-backend gateway patterns (Azure OpenAI i Foundry Models) — Verified (MCP 2026-06-19)
|
||||
|
||||
## For Cosmo
|
||||
## For arkitekten
|
||||
|
||||
- **Bruk denne referansen** når kunden rapporterer høy latens, port-utmattelse, eller timeout-feil mot Azure OpenAI — connection pooling er ofte root cause.
|
||||
- Anbefal `IHttpClientFactory` for .NET og `httpx.AsyncClient` med `Limits` for Python — aldri instansier `HttpClient` per forespørsel.
|
||||
|
|
|
|||
|
|
@ -20,7 +20,7 @@
|
|||
- [Norsk offentlig sektor](#norsk-offentlig-sektor)
|
||||
- [Beslutningsrammeverk](#beslutningsrammeverk)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
- [For arkitekten](#for-arkitekten)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
|
|
@ -441,7 +441,7 @@ ml_client.online_deployments.begin_create_or_update(deployment).result()
|
|||
- [GPU optimized VM sizes](https://learn.microsoft.com/azure/virtual-machines/sizes-gpu) — Azure GPU VM-oversikt
|
||||
- [Deploy models in Azure ML](https://learn.microsoft.com/azure/machine-learning/how-to-deploy-online-endpoints) — ML endpoint deployment
|
||||
|
||||
## For Cosmo
|
||||
## For arkitekten
|
||||
|
||||
- **Bruk denne referansen** når kunden trenger å velge mellom PTU og Standard for Azure OpenAI, eller når de vurderer self-hosted modeller.
|
||||
- For de fleste norske offentlige organisasjoner er Azure OpenAI PTU det riktige valget — unngå overhead med GPU-management med mindre datakontroll er et absolutt krav.
|
||||
|
|
|
|||
|
|
@ -18,7 +18,7 @@
|
|||
- [Provisioned Throughput Units (PTU) for forutsigbar latens](#provisioned-throughput-units-ptu-for-forutsigbar-latens)
|
||||
- [Overvaking og malinger](#overvaking-og-malinger)
|
||||
- [Sjekkliste for latensoptimalisering](#sjekkliste-for-latensoptimalisering)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
- [For arkitekten](#for-arkitekten)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
|
|
@ -476,7 +476,7 @@ AzureDiagnostics
|
|||
| 7 | Separer arbeidslaster pa egne deployments | 10-20% reduksjon |
|
||||
| 8 | Vurder PTU for stabile produksjonslaster | Forutsigbar latens |
|
||||
|
||||
## For Cosmo
|
||||
## For arkitekten
|
||||
|
||||
- **Latens er sammensatt:** Optimaliser hele pipelinen, ikke bare modellvalget. Max tokens, connection reuse, regionvalg og prompt caching bidrar alle.
|
||||
- **Sweden Central er forstevalg** for norske deployments med lavest latens (~10-20 ms) og EU-datasuverenitet. North Europe som failover.
|
||||
|
|
|
|||
|
|
@ -19,7 +19,7 @@
|
|||
- [Norsk offentlig sektor](#norsk-offentlig-sektor)
|
||||
- [Beslutningsrammeverk](#beslutningsrammeverk)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
- [For arkitekten](#for-arkitekten)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
|
|
@ -440,7 +440,7 @@ azure-openai-benchmark \
|
|||
- [Performance and latency](https://learn.microsoft.com/azure/foundry/openai/how-to/latency) — Throughput vs latency forklaring
|
||||
- [Capacity planning](https://learn.microsoft.com/azure/well-architected/performance-efficiency/capacity-planning) — WAF kapasitetsplanlegging
|
||||
|
||||
## For Cosmo
|
||||
## For arkitekten
|
||||
|
||||
- **Bruk denne referansen** når kunden skal dimensjonere Azure OpenAI-deployment, validere ytelse før lansering, eller feilsøke ytelsesprobler i produksjon.
|
||||
- Alltid bruk azure-openai-benchmark for PTU-dimensjonering — kapasitetskalkulatoren gir estimater, benchmarking gir reelle tall.
|
||||
|
|
|
|||
|
|
@ -20,7 +20,7 @@
|
|||
- [Beslutningsrammeverk](#beslutningsrammeverk)
|
||||
- [Modellvalg og routing-strategi (oppdatert 2026-04)](#modellvalg-og-routing-strategi-oppdatert-2026-04)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
- [For arkitekten](#for-arkitekten)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
|
|
@ -449,7 +449,7 @@ def route_to_model(user_input: str) -> str:
|
|||
- [Customize a model with fine-tuning](https://learn.microsoft.com/azure/foundry/openai/how-to/fine-tuning) — Fine-tuning guide
|
||||
- [Choose the right AI model](https://learn.microsoft.com/azure/architecture/ai-ml/guide/choose-ai-model) — Modellvalg-guide
|
||||
|
||||
## For Cosmo
|
||||
## For arkitekten
|
||||
|
||||
- **Bruk denne referansen** når kunden har høyt volum av repetitive AI-oppgaver og ønsker å redusere kostnader uten å miste kvalitet.
|
||||
- Stored Completions → Distill-flyten i Microsoft Foundry er den enkleste veien — ingen manuell datakuratering nødvendig.
|
||||
|
|
|
|||
|
|
@ -19,7 +19,7 @@
|
|||
- [Norsk offentlig sektor](#norsk-offentlig-sektor)
|
||||
- [Beslutningsrammeverk](#beslutningsrammeverk)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
- [For arkitekten](#for-arkitekten)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
|
|
@ -555,7 +555,7 @@ async def ci_benchmark_gate(
|
|||
- [Evaluate generative AI models](https://learn.microsoft.com/azure/foundry/how-to/evaluate-generative-ai-app) — Kvalitetsevaluering
|
||||
- [Azure Monitor metrics](https://learn.microsoft.com/azure/foundry-classic/openai/how-to/monitor-openai) — Azure OpenAI monitoring
|
||||
|
||||
## For Cosmo
|
||||
## For arkitekten
|
||||
|
||||
- **Bruk denne referansen** når kunden trenger å etablere ytelsesbaselines, sette opp regelmessig ytelsestesting, eller integrere benchmarks i CI/CD.
|
||||
- Et benchmark framework er IKKE valgfritt for produksjons-AI — uten baseline kan du ikke oppdage regresjoner eller validere forbedringer.
|
||||
|
|
|
|||
|
|
@ -19,7 +19,7 @@
|
|||
- [Norsk offentlig sektor](#norsk-offentlig-sektor)
|
||||
- [Beslutningsrammeverk](#beslutningsrammeverk)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
- [For arkitekten](#for-arkitekten)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
|
|
@ -380,7 +380,7 @@ class CacheAwarePromptManager:
|
|||
- [Semantic cache with Cosmos DB](https://learn.microsoft.com/azure/cosmos-db/gen-ai/semantic-cache) — Ekstern caching
|
||||
- [Application design for AI workloads](https://learn.microsoft.com/azure/well-architected/ai/application-design) — Multi-layer caching
|
||||
|
||||
## For Cosmo
|
||||
## For arkitekten
|
||||
|
||||
- **Bruk denne referansen** når kunden vil redusere kostnader eller latens for Azure OpenAI-workloads med repetitive prompt-strukturer.
|
||||
- Hovedregelen: Statisk innhold FØRST i prompten, dynamisk innhold SIST — alt statisk prefix caches automatisk.
|
||||
|
|
|
|||
|
|
@ -20,7 +20,7 @@
|
|||
- [Norsk offentlig sektor](#norsk-offentlig-sektor)
|
||||
- [Beslutningsrammeverk](#beslutningsrammeverk)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
- [For arkitekten](#for-arkitekten)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
|
|
@ -495,7 +495,7 @@ Microsoft dokumenterer multi-backend gateway som den anbefalte arkitekturmønste
|
|||
- [Azure OpenAI SDK retry handling](https://learn.microsoft.com/azure/foundry/openai/supported-languages) — SDK retry-konfigurasjon
|
||||
- [Use a gateway in front of multiple Azure OpenAI deployments or instances](https://learn.microsoft.com/azure/architecture/ai-ml/guide/azure-openai-gateway-multi-backend) — Multi-region gateway (Azure OpenAI i Foundry Models) — Verified (MCP 2026-06-19)
|
||||
|
||||
## For Cosmo
|
||||
## For arkitekten
|
||||
|
||||
- **Bruk denne referansen** når kunden opplever 429-feil, planlegger kvotestrategi, eller designer multi-region failover for Azure OpenAI.
|
||||
- Alltid sjekk og respekter `Retry-After` headeren — SDK-ene gjør dette automatisk, men custom-klienter må implementere det.
|
||||
|
|
|
|||
|
|
@ -21,7 +21,7 @@
|
|||
- [Norsk offentlig sektor](#norsk-offentlig-sektor)
|
||||
- [Beslutningsrammeverk](#beslutningsrammeverk)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
- [For arkitekten](#for-arkitekten)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
|
|
@ -419,7 +419,7 @@ Microsoft dokumenterer nå fire formelle topologier for Azure OpenAI gateway:
|
|||
- [Azure OpenAI deployment types](https://learn.microsoft.com/azure/foundry/foundry-models/concepts/deployment-types) — Global vs Regional
|
||||
- [AI Ready — Establish AI reliability](https://learn.microsoft.com/azure/cloud-adoption-framework/scenarios/ai/ready) — Multi-region best practices
|
||||
|
||||
## For Cosmo
|
||||
## For arkitekten
|
||||
|
||||
- **Bruk denne referansen** når kunden trenger å velge Azure-region for Azure OpenAI, designer multi-region arkitektur, eller har krav til data residency.
|
||||
- For norsk offentlig sektor: start med Regional Norway East + Data Zone EU failover — dette dekker de fleste krav.
|
||||
|
|
|
|||
|
|
@ -19,7 +19,7 @@
|
|||
- [Norsk offentlig sektor](#norsk-offentlig-sektor)
|
||||
- [Beslutningsrammeverk](#beslutningsrammeverk)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
- [For arkitekten](#for-arkitekten)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
|
|
@ -484,7 +484,7 @@ class ResilientStreamProcessor:
|
|||
- [API Management SSE configuration](https://learn.microsoft.com/azure/api-management/how-to-server-sent-events) — APIM SSE
|
||||
- [Server-Sent Events with App Gateway for Containers](https://learn.microsoft.com/azure/application-gateway/for-containers/server-sent-events) — Container SSE
|
||||
|
||||
## For Cosmo
|
||||
## For arkitekten
|
||||
|
||||
- **Bruk denne referansen** når kunden implementerer streaming i AI-applikasjoner, trenger å chunke store responser, eller har feilhåndteringsproblemer med SSE.
|
||||
- Streaming er alltid anbefalt for brukervendte applikasjoner — time-to-first-token reduseres fra sekunder til millisekunder.
|
||||
|
|
|
|||
|
|
@ -18,7 +18,7 @@
|
|||
- [Nar bruke streaming vs. non-streaming](#nar-bruke-streaming-vs-non-streaming)
|
||||
- [Avanserte monstre](#avanserte-monstre)
|
||||
- [Ytelsesmal for streaming](#ytelsesmal-for-streaming)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
- [For arkitekten](#for-arkitekten)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
|
|
@ -639,7 +639,7 @@ async def stream_with_token_counting(messages: list, model: str = "gpt-4o"):
|
|||
| Reconnect-tid | < 2 s | > 10 s |
|
||||
| Stream completion rate | > 99% | < 95% |
|
||||
|
||||
## For Cosmo
|
||||
## For arkitekten
|
||||
|
||||
- **Streaming er obligatorisk** for alle brukerrettede AI-grensesnitt. Forskjellen i opplevd latens er dramatisk: 200 ms TTFT vs. 3-5 sekunders ventetid for komplett respons.
|
||||
- **Infrastruktur-konfigurasjon er kritisk:** Hele kjeden (APIM, App Gateway, Front Door) ma ha response buffering deaktivert. En enkelt feilkonfigurert komponent blokkerer all streaming.
|
||||
|
|
|
|||
|
|
@ -20,7 +20,7 @@
|
|||
- [Norsk offentlig sektor](#norsk-offentlig-sektor)
|
||||
- [Beslutningsrammeverk](#beslutningsrammeverk)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
- [For arkitekten](#for-arkitekten)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
|
|
@ -454,7 +454,7 @@ def submit_batch(client: AzureOpenAI, filename: str):
|
|||
- [Provisioned throughput onboarding](https://learn.microsoft.com/azure/foundry/openai/concepts/provisioned-throughput-billing) — PTU sizing og kostnader
|
||||
- [Azure OpenAI Benchmark Tool](https://github.com/Azure/azure-openai-benchmark) — Offisielt benchmarking-verktøy
|
||||
|
||||
## For Cosmo
|
||||
## For arkitekten
|
||||
|
||||
- **Bruk denne referansen** når kunden trenger å maksimere throughput for AI-workloads, eller når de opplever at de ikke utnytter sin tildelte kvote effektivt.
|
||||
- Batch API gir 50% kostnadsreduksjon og bør anbefales for alle ikke-sanntids workloads — mange kunder er ikke klar over denne muligheten.
|
||||
|
|
|
|||
|
|
@ -19,7 +19,7 @@
|
|||
- [Norsk offentlig sektor](#norsk-offentlig-sektor)
|
||||
- [Beslutningsrammeverk](#beslutningsrammeverk)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
- [For arkitekten](#for-arkitekten)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
|
|
@ -349,7 +349,7 @@ print(f"Rejected predictions: {usage.rejected_prediction_tokens}")
|
|||
- [Predicted outputs](https://learn.microsoft.com/azure/foundry/openai/how-to/predicted-outputs) — Spekulativ generering
|
||||
- [Foundry PTU calculator](https://ai.azure.com/resource/calculator) — Kapasitetskalkulator
|
||||
|
||||
## For Cosmo
|
||||
## For arkitekten
|
||||
|
||||
- **Bruk denne referansen** når kunden ønsker å optimalisere responstid for AI-tjenester, eller når de skal dimensjonere PTU-deployments.
|
||||
- TPS-mål varierer dramatisk mellom modeller: gpt-4.1-nano gir 100 TPS vs. gpt-4o med 25 TPS — velg modell basert på oppgavens kompleksitet.
|
||||
|
|
|
|||
Loading…
Add table
Add a link
Reference in a new issue