feat(ms-ai-architect): Spor 1 — Port-1-substrat migrert på 4 ikke-advisor-skills (243 Source + 327 Type + 325 TOC + stale-verified poison fjernet) [skip-docs]
Steg 9 (R4): unified migrate-corpus.mjs --write over engineering/governance/ infrastructure/security. 327 filer mutert, verified=null, prosa byte-identisk (fra første ## seksjon), advisor urørt (0 endringer). To applier-fixes oppdaget under kjøring (TDD, RED→GREEN): - insertHeaderFields: anker faller nå tilbake når en meta-linje selv passerer 500B (2 filer pakket et avsnitt i **Status:** → Type/Source landet utenfor scan-vinduet, applierens post-write-assertion fanget + restaurerte). - normalizeStaleVerified: fjerner nå ALLE stale non-date **Verified:** i 500B-vinduet, inkl. stray body-dup rett under --- (9 mlops-genaiops-filer var ellers falskt "verified"/fresh, droppet fra worklist). Operatør-godkjent utvidelse av carve-out; kun stray metadata-linjer, aldri prosa. test-transform-criterion: precondition oppdatert til post-migrasjons-sannhet (fila bærer nå Source). Suite 728/728 grønn.
This commit is contained in:
parent
ed92d65385
commit
ddce43d8b2
330 changed files with 4643 additions and 83 deletions
|
|
@ -3,9 +3,24 @@
|
|||
**Last updated:** 2026-02
|
||||
**Status:** GA
|
||||
**Category:** API Management & AI Gateway
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/api-management/genai-gateway-capabilities
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekonsepter i Azure API Management](#kjernekonsepter-i-azure-api-management)
|
||||
- [AI Gateway-kapabiliteter](#ai-gateway-kapabiliteter)
|
||||
- [Arkitekturmønstre for AI Gateway](#arkitekturmønstre-for-ai-gateway)
|
||||
- [Governance og organisatorisk styring](#governance-og-organisatorisk-styring)
|
||||
- [Bicep-deployment: AI Gateway](#bicep-deployment-ai-gateway)
|
||||
- [Policy-pipeline for AI Gateway](#policy-pipeline-for-ai-gateway)
|
||||
- [Relevante referansearkitekturer](#relevante-referansearkitekturer)
|
||||
- [Hensyn for norsk offentlig sektor](#hensyn-for-norsk-offentlig-sektor)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Azure API Management (APIM) har utviklet seg fra en tradisjonell API-gateway til en fullverdig AI-gateway som gir organisasjoner sentral kontroll over alle generative AI-tjenester. For norsk offentlig sektor, der mange etater deler Azure OpenAI-instanser på tvers av avdelinger og prosjekter, er APIM den anbefalte tilnærmingen for å sikre styring, kostnadsfordeling og sikkerhet.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** API Management & AI Gateway
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/api-management/backends
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Azure AD Integration](#azure-ad-integration)
|
||||
- [OAuth 2.0 Flows](#oauth-20-flows)
|
||||
- [Managed Identity](#managed-identity)
|
||||
- [Client Certificate Authentication](#client-certificate-authentication)
|
||||
- [API Key Rotation](#api-key-rotation)
|
||||
- [Defense-in-Depth Mønster](#defense-in-depth-mønster)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Autentisering og autorisering er grunnleggende for å sikre AI-tjenester som eksponeres gjennom Azure API Management. Når organisasjoner bygger ut sin AI-plattform med Azure OpenAI, er det kritisk at kun autoriserte applikasjoner og brukere får tilgang, at API-nøkler ikke lekker, og at tilgang kan spores og revideres. APIM tilbyr flere autentiseringsmekanismer som kan kombineres for defense-in-depth.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** API Management & AI Gateway
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/frontdoor/front-door-overview
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Global lastdistribusjon](#global-lastdistribusjon)
|
||||
- [DDoS-beskyttelse](#ddos-beskyttelse)
|
||||
- [Web Application Firewall](#web-application-firewall)
|
||||
- [Edge Caching](#edge-caching)
|
||||
- [Geografisk ruting](#geografisk-ruting)
|
||||
- [Kostnadsestimat for Front Door + APIM](#kostnadsestimat-for-front-door--apim)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Nar organisasjoner ruller ut AI-tjenester globalt eller trenger ekstra beskyttelse og ytelsesoptimalisering, er kombinasjonen av Azure Front Door og Azure API Management en kraftig arkitektur. Azure Front Door gir global HTTP(S)-lastbalansering, DDoS-beskyttelse, Web Application Firewall (WAF), edge caching og TLS-offloading -- alt foran APIM som haandterer AI-spesifikk policy-haaandheving, token-ratebegrensning og backend-lastbalansering.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,25 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** API Management & AI Gateway
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/api-management/genai-gateway-capabilities
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Gateway Overhead Analysis](#gateway-overhead-analysis)
|
||||
- [Security Posture Comparison](#security-posture-comparison)
|
||||
- [Governance Requirements](#governance-requirements)
|
||||
- [Cost per Request](#cost-per-request)
|
||||
- [Organizational Scale Factors](#organizational-scale-factors)
|
||||
- [Migrasjonsvei: Direkte → APIM](#migrasjonsvei-direkte--apim)
|
||||
- [Hybrid-tilnærminger](#hybrid-tilnærminger)
|
||||
- [Well-Architected Framework Perspektiv](#well-architected-framework-perspektiv)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
En av de første arkitekturbeslutningene ved implementering av Azure OpenAI er om applikasjoner skal koble seg direkte til Azure OpenAI-endepunktene, eller om trafikken skal gå gjennom en gateway som Azure API Management. Svaret avhenger av organisasjonens størrelse, sikkerhetskrav, antall applikasjoner og modelldeployments, samt behovet for sentral styring og observerbarhet.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,24 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** API Management & AI Gateway
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/api-management/genai-gateway-capabilities
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Backend Configuration](#backend-configuration)
|
||||
- [Load-Balanced Backend Pools](#load-balanced-backend-pools)
|
||||
- [Health Probe Policies](#health-probe-policies)
|
||||
- [Custom Health Checks](#custom-health-checks)
|
||||
- [Timeout and Retry Logic](#timeout-and-retry-logic)
|
||||
- [Pool Metrics](#pool-metrics)
|
||||
- [Best Practices](#best-practices)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Backend pool management i Azure API Management er fundamentalt for å bygge robuste AI-gateways. Når organisasjoner skalerer sin bruk av Azure OpenAI og andre LLM-tjenester, trenger de en mekanisme for å distribuere trafikk på tvers av flere backend-instanser, håndtere throttling gracefully, og sikre at feilende backends ikke påvirker sluttbrukere. APIM backend pools gir nettopp denne kapabiliteten med støtte for round-robin, vektet, prioritetsbasert og session-aware load balancing.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** API Management & AI Gateway
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/api-management/caching-overview
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Prompt-baserte caching-nokler](#prompt-baserte-caching-nokler)
|
||||
- [Semantisk deduplisering](#semantisk-deduplisering)
|
||||
- [TTL-konfigurasjon](#ttl-konfigurasjon)
|
||||
- [Cache-invalidering](#cache-invalidering)
|
||||
- [Kostnadsbesparelsesanalyse](#kostnadsbesparelsesanalyse)
|
||||
- [Caching-tjenester: Intern vs. Ekstern](#caching-tjenester-intern-vs-ekstern)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Caching er en av de mest effektive strategiene for a redusere kostnader og forbedre ytelse i AI-applikasjoner. Azure API Management tilbyr bade tradisjonell HTTP-caching og semantisk caching spesielt designet for LLM-API-er. Semantisk caching bruker embedding-vektorer for a identifisere prompts som er semantisk like -- ikke bare identiske -- og returnere cachede svar uten a kalle backend-modellen.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,24 @@
|
|||
**Last updated:** 2026-02
|
||||
**Status:** GA
|
||||
**Category:** API Management & AI Gateway
|
||||
**Type:** reference
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Circuit Breaker State Machine](#circuit-breaker-state-machine)
|
||||
- [Konfigurasjon](#konfigurasjon)
|
||||
- [Failure Threshold Tuning](#failure-threshold-tuning)
|
||||
- [Fallback-policies](#fallback-policies)
|
||||
- [Recovery-mekanismer](#recovery-mekanismer)
|
||||
- [Timeout-konfigurasjon](#timeout-konfigurasjon)
|
||||
- [Avanserte mønstre](#avanserte-mønstre)
|
||||
- [Anti-mønstre](#anti-mønstre)
|
||||
- [Komplett resiliens-policy](#komplett-resiliens-policy)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Circuit breaker-mønsteret er en grunnleggende resiliensmekanisme for AI-applikasjoner som kommuniserer med Azure OpenAI og andre LLM-backends. Når en backend-tjeneste blir overbelastet eller utilgjengelig, forhindrer circuit breaker at applikasjonen fortsetter å sende forespørsler som uansett vil feile. I stedet "bryter kretsen" og returnerer en feilmelding umiddelbart, slik at backend-tjenesten får tid til å gjenopprette seg.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-19
|
||||
**Status:** GA
|
||||
**Category:** API Management & AI Gateway
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/cost-management-billing/costs/overview-cost-management
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Token Counting from Responses](#token-counting-from-responses)
|
||||
- [Model Routing Tracking](#model-routing-tracking)
|
||||
- [Chargeback Tagging](#chargeback-tagging)
|
||||
- [Azure Cost Management Integration](#azure-cost-management-integration)
|
||||
- [Custom Metrics](#custom-metrics)
|
||||
- [FinOps Integrasjon](#finops-integrasjon)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Når organisasjoner skalerer sin bruk av Azure OpenAI og andre AI-tjenester, blir kostnadssynlighet og tildeling av kostnader til riktig avdeling, prosjekt eller team en kritisk utfordring. Azure API Management (APIM) fungerer som et naturlig punkt for å samle inn kostnadsdata fra AI-modeller gjennom policyer som fanger token-bruk, modell-informasjon og forbruker-identitet. Denne informasjonen kan deretter brukes for intern fakturering (chargeback) og kostnadsoptimalisering.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** API Management & AI Gateway
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/api-management/developer-portal-overview
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Portaltilpasning](#portaltilpasning)
|
||||
- [API-dokumentasjon](#api-dokumentasjon)
|
||||
- [Interaktiv testkonsoll](#interaktiv-testkonsoll)
|
||||
- [API-nokkelhondtering](#api-nokkelhondtering)
|
||||
- [Selvbetjeningsarbeidsflyt for brukere](#selvbetjeningsarbeidsflyt-for-brukere)
|
||||
- [Azure API Center: Komplementaer katalog](#azure-api-center-komplementaer-katalog)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Azure API Managements Developer Portal er en automatisk generert, fullt tilpassbar nettside for API-dokumentasjon og selvbetjening. Nar organisasjoner eksponerer AI-modeller som API-er gjennom APIM, blir Developer Portal den sentrale plattformen der utviklere oppdager tilgjengelige AI-kapabiliteter, tester modeller interaktivt, administrerer API-nokler og overvaker eget forbruk. I tillegg tilbyr Azure API Center et komplementaert API-katalogverktoy.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,24 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** API Management & AI Gateway
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/ai-services/content-safety/concepts/jailbreak-detection
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Content Safety Integration](#content-safety-integration)
|
||||
- [Prompt Validation Policies](#prompt-validation-policies)
|
||||
- [Response Filtering](#response-filtering)
|
||||
- [Rate Limiting per Model](#rate-limiting-per-model)
|
||||
- [Audit Logging for Prompts](#audit-logging-for-prompts)
|
||||
- [Komplett GenAI Policy Stack](#komplett-genai-policy-stack)
|
||||
- [GenAI Policy Referanse](#genai-policy-referanse)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Azure API Management (APIM) inkluderer et sett med policyer spesifikt designet for generativ AI (GenAI). Disse policyene går utover tradisjonell API-gateway-funksjonalitet og adresserer unike utfordringer ved AI-workloads: content safety-modererering, prompt-validering, token-basert rate limiting, semantic caching, og audit-logging av prompts og completions. Samlet utgjør de kjernen i APIM sin AI gateway-kapabilitet.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-02
|
||||
**Status:** GA
|
||||
**Category:** API Management & AI Gateway
|
||||
**Type:** reference
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Backend Pool-konsepter](#backend-pool-konsepter)
|
||||
- [Load Balancing-strategier](#load-balancing-strategier)
|
||||
- [Individual Backend-konfigurasjon](#individual-backend-konfigurasjon)
|
||||
- [Deployment Slot Selection](#deployment-slot-selection)
|
||||
- [Regional Distribution](#regional-distribution)
|
||||
- [Throttling og Retry-håndtering](#throttling-og-retry-håndtering)
|
||||
- [Komplett Bicep-eksempel](#komplett-bicep-eksempel)
|
||||
- [Overvåking og feilsøking](#overvåking-og-feilsøking)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Lastbalansering på tvers av flere Azure OpenAI-instanser er en kritisk kapabilitet for enterprise AI-arkitekturer. Azure OpenAI har begrensninger på tokens per minutt (TPM) og requests per minutt (RPM) per deployment, og én enkelt instans vil sjelden dekke behovene til en hel organisasjon. Ved å distribuere trafikk over flere instanser -- gjerne i ulike regioner -- kan organisasjoner øke total kapasitet, forbedre tilgjengelighet og optimalisere kostnader.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,24 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** API Management & AI Gateway
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/api-management/genai-gateway-capabilities
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Application Insights-integrasjon](#application-insights-integrasjon)
|
||||
- [Custom Metrics med Token-sporring](#custom-metrics-med-token-sporring)
|
||||
- [Token Tracking](#token-tracking)
|
||||
- [Latency-overvaking](#latency-overvaking)
|
||||
- [Brukeratferdsanalyse](#brukeratferdsanalyse)
|
||||
- [Eksport til Microsoft Foundry for modellevaluering](#eksport-til-microsoft-foundry-for-modellevaluering)
|
||||
- [Personvern og compliance](#personvern-og-compliance)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Observability er fundamentalt for a drifte AI-applikasjoner i produksjon. Azure API Management tilbyr omfattende logging- og analysekapabiliteter spesielt tilpasset AI-trafikk, inkludert token-sporring, prompt/completion-logging og innebygde dashboards for LLM-bruk. Disse verktoyene lar organisasjoner spore kostnader, overvake ytelse, sikre compliance og feilsoke problemer med AI-API-er.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** API Management & AI Gateway
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/foundry/foundry-models/concepts/deployment-types
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Global APIM Distribution](#global-apim-distribution)
|
||||
- [Region-Aware Routing](#region-aware-routing)
|
||||
- [Latency Optimization](#latency-optimization)
|
||||
- [Data Residency Compliance](#data-residency-compliance)
|
||||
- [Cross-Region Failover](#cross-region-failover)
|
||||
- [Nettverksarkitektur](#nettverksarkitektur)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Organisasjoner som bygger AI-drevne tjenester med Azure OpenAI og andre LLM-tjenester trenger en gateway-arkitektur som tåler regionale feil, minimerer latens for geografisk distribuerte brukere, og overholder krav til dataresidency. Azure API Management (APIM) med multi-region deployment gir nettopp denne kapabiliteten, og er den anbefalte tilnærmingen for enterprise AI-workloads.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,24 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** API Management & AI Gateway
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/api-management/genai-gateway-capabilities
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Model-agnostiske API-schemaer](#model-agnostiske-api-schemaer)
|
||||
- [Header Rewriting](#header-rewriting)
|
||||
- [Payload-transformasjon](#payload-transformasjon)
|
||||
- [Error Response Normalization](#error-response-normalization)
|
||||
- [Versjonstranslasjon](#versjonstranslasjon)
|
||||
- [Policy Fragments for Reuse](#policy-fragments-for-reuse)
|
||||
- [Bicep: Oppsett av transformasjons-API](#bicep-oppsett-av-transformasjons-api)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Azure API Management (APIM) tilbyr over 75 innebygde policies for transformasjon av foresporsler og svar. Nar organisasjoner eksponerer AI-modeller gjennom APIM som AI gateway, blir transformasjon av request og response kritisk for a standardisere grensesnittet mellom ulike AI-backends (Azure OpenAI, Microsoft Foundry, tredjeparts LLM-er) og konsumerende applikasjoner. Ved a implementere model-agnostiske API-schemaer kan man bytte ut underliggende modeller uten a bryte klientkontrakter.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** API Management & AI Gateway
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/api-management/genai-gateway-capabilities
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [IP-hvitelisting og -filtrering](#ip-hvitelisting-og--filtrering)
|
||||
- [Prompt Injection-forebygging](#prompt-injection-forebygging)
|
||||
- [PII-deteksjon og -maskering](#pii-deteksjon-og--maskering)
|
||||
- [Mutual TLS (mTLS)](#mutual-tls-mtls)
|
||||
- [Revisjonssporing og audit trail](#revisjonssporing-og-audit-trail)
|
||||
- [Sikkerhetssjekksliste for AI Gateway](#sikkerhetssjekksliste-for-ai-gateway)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Sikkerhet for AI-gateways krever en flerlagstilnaerming som dekker bade tradisjonelle API-sikkerhetstrusler og AI-spesifikke angrepsoverflater. Azure API Management som AI gateway tilbyr over 20 sikkerhetspolicies, fra IP-filtrering og sertifikatvalidering til AI-spesifikk innholdsmoderasjon og prompt injection-forebygging. En godt herdet AI gateway beskytter mot uautorisert tilgang, datalekkasje, prompt injection og misbruk av kostbare AI-ressurser.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,26 @@
|
|||
**Last updated:** 2026-02
|
||||
**Status:** GA
|
||||
**Category:** API Management & AI Gateway
|
||||
**Type:** reference
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Arkitektur](#arkitektur)
|
||||
- [Forutsetninger](#forutsetninger)
|
||||
- [Cache-lookup og Cache-store Policies](#cache-lookup-og-cache-store-policies)
|
||||
- [Embedding-Based Similarity](#embedding-based-similarity)
|
||||
- [Cache Invalidation Strategies](#cache-invalidation-strategies)
|
||||
- [Cost Savings Analysis](#cost-savings-analysis)
|
||||
- [Privacy Considerations](#privacy-considerations)
|
||||
- [Rate Limiting etter Cache Lookup](#rate-limiting-etter-cache-lookup)
|
||||
- [Verifisering og feilsøking](#verifisering-og-feilsøking)
|
||||
- [Komplett policy for semantic caching](#komplett-policy-for-semantic-caching)
|
||||
- [Tier-kompatibilitet](#tier-kompatibilitet)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Semantic caching i Azure API Management er en teknikk som reduserer kostnader og latens for LLM-baserte applikasjoner ved å gjenbruke tidligere genererte completions. I motsetning til tradisjonell nøkkelbasert caching, bruker semantic caching embeddings og vektorlikhet til å identifisere semantisk like prompts -- selv når ordlyden er forskjellig. "Hva er hovedstaden i Norge?" og "Hvilken by er Norges hovedstad?" gir samme cachede svar.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,25 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** API Management & AI Gateway
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/api-management/genai-gateway-capabilities
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [SSE Forwarding](#sse-forwarding)
|
||||
- [Buffering Policies](#buffering-policies)
|
||||
- [Chunked Responses](#chunked-responses)
|
||||
- [Timeout Management for Streams](#timeout-management-for-streams)
|
||||
- [Client Compatibility](#client-compatibility)
|
||||
- [Logging av Streaming-requests](#logging-av-streaming-requests)
|
||||
- [Token-telling for Streaming](#token-telling-for-streaming)
|
||||
- [Komplett Streaming-policy](#komplett-streaming-policy)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Streaming av AI-responser er en nøkkelfunksjon for å levere god brukeropplevelse i chat-applikasjoner. Azure OpenAI støtter Server-Sent Events (SSE) for å streame chat completions token-for-token til klienten, noe som gir umiddelbar feedback i stedet for å vente på en komplett respons. Når Azure API Management (APIM) sitter mellom klient og Azure OpenAI, krever denne streaming-arkitekturen spesifikk konfigurasjon for å fungere korrekt.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,26 @@
|
|||
**Last updated:** 2026-02
|
||||
**Status:** GA
|
||||
**Category:** API Management & AI Gateway
|
||||
**Type:** reference
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Token-telling i APIM](#token-telling-i-apim)
|
||||
- [Policy-referanse](#policy-referanse)
|
||||
- [Counter-key-strategier](#counter-key-strategier)
|
||||
- [Rate Limit-algoritmer](#rate-limit-algoritmer)
|
||||
- [Kvoter over lengre perioder](#kvoter-over-lengre-perioder)
|
||||
- [Multi-region-hensyn](#multi-region-hensyn)
|
||||
- [Feilhåndtering og respons-headers](#feilhåndtering-og-respons-headers)
|
||||
- [Burst Allowances og Concurrency Control](#burst-allowances-og-concurrency-control)
|
||||
- [Monitorering av token-forbruk](#monitorering-av-token-forbruk)
|
||||
- [Tier-kompatibilitet](#tier-kompatibilitet)
|
||||
- [Best Practices](#best-practices)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Token-basert rate limiting er den viktigste mekanismen for å kontrollere forbruk av AI-tjenester i Azure API Management. I motsetning til tradisjonell request-basert throttling, teller APIM faktisk antall tokens som konsumeres av hver LLM-forespørsel og håndhever grenser basert på dette. Dette er essensielt for norsk offentlig sektor der flere etater og prosjekter deler Azure OpenAI-ressurser og trenger presis kostnadskontroll.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** API Management & AI Gateway
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/api-management/genai-gateway-capabilities
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Versjoneringsstrategier i APIM](#versjoneringsstrategier-i-apim)
|
||||
- [Avviklingsfrister (Deprecation Timelines)](#avviklingsfrister-deprecation-timelines)
|
||||
- [Modellversjonsmapping](#modellversjonsmapping)
|
||||
- [Migreringsstrategier](#migreringsstrategier)
|
||||
- [Revisjonsstyring for ikke-brytende endringer](#revisjonsstyring-for-ikke-brytende-endringer)
|
||||
- [Handtering av brytende endringer](#handtering-av-brytende-endringer)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
API-versjonering er kritisk for AI-tjenester der underliggende modeller endres hyppig, nye kapabiliteter legges til og eldre versjoner fases ut. Azure API Management tilbyr tre versjoneringsstrategier (URL-path, header og query string) samt revisjonsstyring for ikke-brytende endringer. For AI-API-er er dette spesielt utfordrende fordi modellversjoner, API-schemaer og responsformater kan endres uavhengig av hverandre.
|
||||
|
|
|
|||
Loading…
Add table
Add a link
Reference in a new issue