feat(ms-ai-architect): Spor 1 — Port-1-substrat migrert på 4 ikke-advisor-skills (243 Source + 327 Type + 325 TOC + stale-verified poison fjernet) [skip-docs]

Steg 9 (R4): unified migrate-corpus.mjs --write over engineering/governance/
infrastructure/security. 327 filer mutert, verified=null, prosa byte-identisk
(fra første ## seksjon), advisor urørt (0 endringer).

To applier-fixes oppdaget under kjøring (TDD, RED→GREEN):
- insertHeaderFields: anker faller nå tilbake når en meta-linje selv passerer
  500B (2 filer pakket et avsnitt i **Status:** → Type/Source landet utenfor
  scan-vinduet, applierens post-write-assertion fanget + restaurerte).
- normalizeStaleVerified: fjerner nå ALLE stale non-date **Verified:** i
  500B-vinduet, inkl. stray body-dup rett under --- (9 mlops-genaiops-filer var
  ellers falskt "verified"/fresh, droppet fra worklist). Operatør-godkjent
  utvidelse av carve-out; kun stray metadata-linjer, aldri prosa.

test-transform-criterion: precondition oppdatert til post-migrasjons-sannhet
(fila bærer nå Source). Suite 728/728 grønn.
This commit is contained in:
Kjell Tore Guttormsen 2026-07-04 10:19:11 +02:00
commit ddce43d8b2
330 changed files with 4643 additions and 83 deletions

View file

@ -3,9 +3,23 @@
**Last updated:** 2026-06-19
**Status:** GA
**Category:** Business Continuity & Disaster Recovery
**Type:** reference
**Source:** https://learn.microsoft.com/azure/azure-monitor/alerts/alerts-overview
---
## Innhold
- [Introduksjon](#introduksjon)
- [Health check-endepunkter og heartbeats](#health-check-endepunkter-og-heartbeats)
- [Latens og feilrate-overvåking](#latens-og-feilrate-overvåking)
- [Custom metrics for AI-tjenestehelse](#custom-metrics-for-ai-tjenestehelse)
- [Alert-regler og eskaleringspolicyer](#alert-regler-og-eskaleringspolicyer)
- [Integrasjon med incident management-systemer](#integrasjon-med-incident-management-systemer)
- [Application Insights for AI-agenter i BCDR-kontekst *(Verified MCP 2026-06-19)*](#application-insights-for-ai-agenter-i-bcdr-kontekst-verified-mcp-2026-06-19)
- [Referanser](#referanser)
- [For Cosmo](#for-cosmo)
## Introduksjon
Rask og pålitelig deteksjon av feil er avgjørende for å minimere nedetid i AI-systemer. Failover-deteksjon handler om å oppdage at en tjeneste eller region har feilet, og å initiere gjenopprettingsprosessen så raskt som mulig. For AI-workloads er dette spesielt viktig fordi forsinkede svar eller manglende tilgjengelighet direkte påvirker brukeropplevelsen.