fix(ms-ai-architect): Spor 0 — 37 kilde-verifiserte KB-feil fikset (25 ref-filer), 1 avvist [skip-docs]
Per-kilde verifiserings-agenter (Opus xhigh, live microsoft_docs_fetch) bekreftet hver verdi mot kilden FOER endring; alle forekomster av samme gale fakta fikset fil-vidt (ikke bare sitert linje). - 37/38 confirm-fix anvendt; #8 (model-selection «Model Router GA») AVVIST: fila var allerede korrekt (Model Router GA siden 2025-11-18); den siterte model-choice-guide har utdatert «(preview)»-etikett. AA «fikse» ville innfoert en feil. - Tverteklynger reconciled til kilde-sann verdi: AI Search storage (S1 160/S2 512/S3 1024/L1 2048/L2 4096 GB; vektor 5/35/150/300), Quota Tiers (erstatter Default/Enterprise + «1 Unit Capacity»). - Hoey-innsats: realtime Schrems II omskrevet (global deployment != EU-residens, selv-verifisert mot kilde); Data Zone Norway East = gpt-5.4 OG gpt-5.5 (ikke kun 5.5); computer-use = gpt-5.4 + computer-tool (region flagget for verifisering). - Suite 552/552 groenn. Manifest oppdatert (fixed/verdict/verified per fiks). Spor 1-froe (cross-fil-gjentakelser i UBEROERTE filer): «DDoS Protection Standard» i ros-ai-threat-library.md + zero-trust-ai-services.md. Tilstoetende funn (ikke i de 38): se docs / STATE.
This commit is contained in:
parent
2b6fb62f53
commit
2c54f0d5a0
26 changed files with 327 additions and 207 deletions
|
|
@ -22,10 +22,10 @@ Utfordringen for arkitekter er å balansere kostnad (monitoreringsdata lagres i
|
|||
|---------|-------------|-------------------|-----------|
|
||||
| `AzureOpenAIRequests` | Totalt antall API-kall over tid | PT1M (1 minutt) | Ja |
|
||||
| `AzureOpenAIAvailabilityRate` | `(Total Calls - Server Errors) / Total Calls` (%) | PT1M | Nei |
|
||||
| `TokensGenerated` | Completion tokens generert | PT1M | Ja |
|
||||
| `GeneratedTokens` | Completion tokens generert | PT1M | Ja |
|
||||
| `ActiveTokens` | Totale tokens (prompt + completion) | PT1M | Ja |
|
||||
| `PTUUtilization` | Prosentvis bruk av PTU-kapasitet | PT1M | Ja |
|
||||
| `ProcessingTime` | End-to-end latency (ms) | PT1M | Ja |
|
||||
| `AzureOpenAIProvisionedManagedUtilizationV2` | Prosentvis bruk av PTU-kapasitet | PT1M | Nei |
|
||||
| `AzureOpenAITimeToResponse` | Time to response (ms) | PT1M | Ja |
|
||||
|
||||
**Viktig:** Platform metrics samles automatisk uten konfigurasjon, men for å analysere i Log Analytics må diagnostic settings aktiveres.
|
||||
|
||||
|
|
@ -38,14 +38,14 @@ Utfordringen for arkitekter er å balansere kostnad (monitoreringsdata lagres i
|
|||
| **Quota** | Regionbasert grense per modell/subscription | TPM | Forespørres via support |
|
||||
| **429 Throttling** | HTTP-responskode når rate limit overstiges | - | Implementer retry-logic |
|
||||
|
||||
**RPM/TPM-ratio varierer per modell:**
|
||||
**RPM/TPM-ratio varierer per modell.** Kvote tildeles nå via **Quota Tiers** (Free Tier (Tier 0) + Tier 1–6), ikke «1 Unit Capacity». Forholdet mellom RPM og TPM er likevel modellspesifikt (verifisert mot Tier 1, GlobalStandard):
|
||||
|
||||
| Modell | 1 Unit Capacity | RPM | TPM |
|
||||
|--------|----------------|-----|-----|
|
||||
| Eldre chat-modeller | 1 | 6 | 1,000 |
|
||||
| o1, o1-preview | 1 | 1 | 6,000 |
|
||||
| o3 | 1 | 1 | 1,000 |
|
||||
| o3-mini, o1-mini | 1 | 1 | 10,000 |
|
||||
| Modell | RPM | TPM |
|
||||
|--------|-----|-----|
|
||||
| Eldre chat-modeller | 6 | 1,000 |
|
||||
| o1, o1-preview | 1 | 6,000 |
|
||||
| o3 | 1 | 1,000 |
|
||||
| o3-mini, o1-mini | 1 | 10,000 |
|
||||
|
||||
**Viktig:** Deployment TPM kan IKKE overskride subscription quota for den modellen i den regionen.
|
||||
|
||||
|
|
@ -172,7 +172,7 @@ PUT https://management.azure.com/subscriptions/{subscriptionId}/resourceGroups/{
|
|||
**Mønster:**
|
||||
- Bruk PTU i stedet for Standard (pay-as-you-go)
|
||||
- PTU gir dedikert kapasitet med forutsigbar latens
|
||||
- Overvåk `PTUUtilization`-metrikk for kapasitetsplanlegging
|
||||
- Overvåk `AzureOpenAIProvisionedManagedUtilizationV2`-metrikk for kapasitetsplanlegging
|
||||
- Sett alert hvis utilization > 80% (signal om behov for oppgradering)
|
||||
|
||||
**Fordeler:**
|
||||
|
|
@ -189,7 +189,7 @@ PUT https://management.azure.com/subscriptions/{subscriptionId}/resourceGroups/{
|
|||
|
||||
```kql
|
||||
AzureMetrics
|
||||
| where MetricName == "PTUUtilization"
|
||||
| where MetricName == "AzureOpenAIProvisionedManagedUtilizationV2"
|
||||
| where TimeGenerated > ago(5m)
|
||||
| summarize AvgUtilization = avg(Average) by Resource
|
||||
| where AvgUtilization > 80
|
||||
|
|
|
|||
|
|
@ -57,8 +57,8 @@ Azure OpenAI samler automatisk token-baserte metrics:
|
|||
|
||||
**Tilgjengelige metrics:**
|
||||
- `TokenTransaction` — Total token count (input + output)
|
||||
- `PromptTokens` — Input tokens
|
||||
- `CompletionTokens` — Output tokens
|
||||
- `InputTokens` — Input tokens
|
||||
- `OutputTokens` — Output tokens
|
||||
- `ProcessedPromptTokens` — Tokens faktisk prosessert (kan avvike ved caching)
|
||||
|
||||
**Aksess via:**
|
||||
|
|
@ -442,7 +442,7 @@ AzureMetrics
|
|||
| **PTU** | Track utilization percentage against reserved capacity |
|
||||
|
||||
**PTU Metrics:**
|
||||
- `PTUUtilization` — Percentage of reserved capacity used
|
||||
- `AzureOpenAIProvisionedManagedUtilizationV2` — Percentage of reserved capacity used
|
||||
- `ProcessedPromptTokens` — Input tokens processed
|
||||
- Input TPM per PTU — Model-specific (f.eks. 8450 TPM for Llama-3.3-70B)
|
||||
|
||||
|
|
@ -455,7 +455,7 @@ AzureMetrics
|
|||
```kusto
|
||||
AzureMetrics
|
||||
| where ResourceProvider == "MICROSOFT.COGNITIVESERVICES"
|
||||
| where MetricName == "PTUUtilization"
|
||||
| where MetricName == "AzureOpenAIProvisionedManagedUtilizationV2"
|
||||
| summarize AvgUtilization = avg(Average), MaxUtilization = max(Maximum)
|
||||
by Resource, bin(TimeGenerated, 1h)
|
||||
| extend EfficiencyStatus = case(
|
||||
|
|
|
|||
Loading…
Add table
Add a link
Reference in a new issue