feat(ms-ai-architect): Spor 1 — Port-1-substrat migrert på 4 ikke-advisor-skills (243 Source + 327 Type + 325 TOC + stale-verified poison fjernet) [skip-docs]

Steg 9 (R4): unified migrate-corpus.mjs --write over engineering/governance/
infrastructure/security. 327 filer mutert, verified=null, prosa byte-identisk
(fra første ## seksjon), advisor urørt (0 endringer).

To applier-fixes oppdaget under kjøring (TDD, RED→GREEN):
- insertHeaderFields: anker faller nå tilbake når en meta-linje selv passerer
  500B (2 filer pakket et avsnitt i **Status:** → Type/Source landet utenfor
  scan-vinduet, applierens post-write-assertion fanget + restaurerte).
- normalizeStaleVerified: fjerner nå ALLE stale non-date **Verified:** i
  500B-vinduet, inkl. stray body-dup rett under --- (9 mlops-genaiops-filer var
  ellers falskt "verified"/fresh, droppet fra worklist). Operatør-godkjent
  utvidelse av carve-out; kun stray metadata-linjer, aldri prosa.

test-transform-criterion: precondition oppdatert til post-migrasjons-sannhet
(fila bærer nå Source). Suite 728/728 grønn.
This commit is contained in:
Kjell Tore Guttormsen 2026-07-04 10:19:11 +02:00
commit ddce43d8b2
330 changed files with 4643 additions and 83 deletions

View file

@ -3,9 +3,23 @@
**Last updated:** 2026-02
**Status:** GA
**Category:** Multi-Modal AI
**Type:** reference
---
## Innhold
- [Introduksjon](#introduksjon)
- [Kjernekomponentar](#kjernekomponentar)
- [Alt-tekst generering og WCAG Compliance](#alt-tekst-generering-og-wcag-compliance)
- [Lydbeskrivingar for visuelt innhald](#lydbeskrivingar-for-visuelt-innhald)
- [Undertekstar og transkripsjongenerering](#undertekstar-og-transkripsjongenerering)
- [Brukarpreferansar og hjelpemiddelintegrasjon](#brukarpreferansar-og-hjelpemiddelintegrasjon)
- [Implementeringsmønstre](#implementeringsmønstre)
- [Norsk offentleg sektor](#norsk-offentleg-sektor)
- [Beslutningsrammeverk](#beslutningsrammeverk)
- [For Cosmo](#for-cosmo)
## Introduksjon
Tilgjengeleg AI-design er ikkje berre ein moralsk forplikting — det er eit lovkrav i Noreg og EU. Likestillings- og diskrimineringslova, saman med EUs Web Accessibility Directive og den kommande European Accessibility Act (EAA), stiller konkrete krav til at digitale tenester skal vere tilgjengelege for alle brukarar. Multi-modal AI-system som kombinerer tekst, bilete, tale og video introduserer unike tilgjengelegheitsutfordringar — og moglegheiter.

View file

@ -3,9 +3,23 @@
**Last updated:** 2026-02
**Status:** GA
**Category:** Multi-Modal AI
**Type:** reference
---
## Innhold
- [Introduksjon](#introduksjon)
- [Kjernekomponentar](#kjernekomponentar)
- [Batch Transcription at Scale](#batch-transcription-at-scale)
- [Speaker Attribution og Diarization](#speaker-attribution-og-diarization)
- [Automatic Translation with Context Preservation](#automatic-translation-with-context-preservation)
- [Quality Assurance og Human-in-the-Loop Workflows](#quality-assurance-og-human-in-the-loop-workflows)
- [Implementeringsmønstre](#implementeringsmønstre)
- [Norsk offentleg sektor](#norsk-offentleg-sektor)
- [Beslutningsrammeverk](#beslutningsrammeverk)
- [For Cosmo](#for-cosmo)
## Introduksjon
Azure Speech Services tilbyr omfattande kapabilitetar for transkribering og oversettelse av audio- og videoinnhald. Tenesta støttar sanntids- og batch-transkribering med funksjonar som taleridentifisering (diarization), automatisk språkdeteksjon, ordnivå-tidsstempel og tilpassa talemodeller. For norsk offentleg sektor er dette relevant for møtetranskribering, arkivering av telefonsamtalar, tekstforming av video, og tilgjengeleggjering av audioinnnhald.

View file

@ -3,9 +3,20 @@
**Last updated:** 2026-02
**Status:** GA
**Category:** Multi-Modal AI
**Type:** reference
---
## Innhold
- [Introduksjon](#introduksjon)
- [Video Ingestion og Processing Workflows](#video-ingestion-og-processing-workflows)
- [Face, Speech og Content Detection](#face-speech-og-content-detection)
- [Knowledge Graph Construction frå Video](#knowledge-graph-construction-frå-video)
- [Integrasjon med AI Services](#integrasjon-med-ai-services)
- [Brukstilfelle for norsk offentleg sektor](#brukstilfelle-for-norsk-offentleg-sektor)
- [For Cosmo](#for-cosmo)
## Introduksjon
Azure AI Video Indexer er ein omfattande AI-teneste som ekstraherer djupe innsikter frå video- og lydinnhald. Tenesta køyrer over 30 AI-modellar for å analysere visuelt og auditivt innhald, inkludert transkripsjon, ansiktsdeteksjon, objektgjenkjenning, sentimentanalyse, emneekstraksjon og mykje meir. Video Indexer er bygd på toppen av Azure AI-tenester som Speech, Vision, Translator og Face.

View file

@ -3,9 +3,23 @@
**Last updated:** 2026-02
**Status:** GA
**Category:** Multi-Modal AI
**Type:** reference
---
## Innhold
- [Introduksjon](#introduksjon)
- [Kjernekomponentar](#kjernekomponentar)
- [Vision Encoder Selection og Fine-Tuning](#vision-encoder-selection-og-fine-tuning)
- [Prompt Injection for Visual Grounding](#prompt-injection-for-visual-grounding)
- [Scene Understanding og Spatial Reasoning](#scene-understanding-og-spatial-reasoning)
- [Few-Shot Learning med visuelle eksempel](#few-shot-learning-med-visuelle-eksempel)
- [Implementeringsmønstre](#implementeringsmønstre)
- [Norsk offentleg sektor](#norsk-offentleg-sektor)
- [Beslutningsrammeverk](#beslutningsrammeverk)
- [For Cosmo](#for-cosmo)
## Introduksjon
Integrasjonen av spesialiserte computer vision (CV) modellar med large language models (LLMs) representerer ein av dei viktigaste trendane i AI-arkitektur. I staden for å bruke GPT-4o sin innebygde vision direkte for alle oppgåver, kombinerer avanserte arkitekturar spesialiserte vision encoders med generative LLMs for å oppnå betre nøyaktigheit, lågare kostnad og meir kontrollerte resultat.

View file

@ -3,9 +3,21 @@
**Last updated:** 2026-02
**Status:** GA (DALL-E 3) / Limited Access Preview (GPT-image-1)
**Category:** Multi-Modal AI
**Type:** reference
---
## Innhold
- [Introduksjon](#introduksjon)
- [DALL-E Capabilities og Limitations](#dall-e-capabilities-og-limitations)
- [Content Filtering og Safety](#content-filtering-og-safety)
- [Batch Image Generation](#batch-image-generation)
- [Integration with Document Pipelines](#integration-with-document-pipelines)
- [Tilgjengelegheit (Accessibility) Considerations](#tilgjengelegheit-accessibility-considerations)
- [Merking og transparens](#merking-og-transparens)
- [For Cosmo](#for-cosmo)
## Introduksjon
DALL-E og GPT-image-1 er Azure OpenAI sine bildegenerering-modellar som skapar bilete frå tekstbeskrivelsar. For norsk offentleg sektor opnar desse modellane moglegheiter innanfor visualisering av offentlege planforslag, illustrasjon av informasjonsmateriell, prototyping av brukargrensesnitt, og generering av tilgjengelege bilete for universell utforming.

View file

@ -3,9 +3,23 @@
**Last updated:** 2026-02
**Status:** GA
**Category:** Multi-Modal AI
**Type:** reference
---
## Innhold
- [Introduksjon](#introduksjon)
- [Kjernekomponentar](#kjernekomponentar)
- [Document Layout Analysis](#document-layout-analysis)
- [Tabell- og skjemaekstraksjon](#tabell--og-skjemaekstraksjon)
- [Handskriftgjenkjenning](#handskriftgjenkjenning)
- [Pre- og postprosessering](#pre--og-postprosessering)
- [Implementeringsmønstre](#implementeringsmønstre)
- [Norsk offentleg sektor](#norsk-offentleg-sektor)
- [Beslutningsrammeverk](#beslutningsrammeverk)
- [For Cosmo](#for-cosmo)
## Introduksjon
Azure AI Document Intelligence (tidlegare Form Recognizer) er ein spesialisert teneste for automatisert dokumentbehandling som kombinerer bransjeleiande OCR med djuplæringsmodellar for å ekstrahere tekst, tabellar, strukturar og felt frå dokument. Tenesta støttar eit breitt spekter av dokumenttypar — PDF, bilete, Office-filer og HTML — med ein enkelt API-kall, og leverer resultat i Markdown-format som er optimalisert for integrasjon med LLM-ar i RAG-pipelines.

View file

@ -3,9 +3,21 @@
**Last updated:** 2026-02
**Status:** GA
**Category:** Multi-Modal AI
**Type:** reference
---
## Innhold
- [Introduksjon](#introduksjon)
- [GPT-4o Vision Capabilities](#gpt-4o-vision-capabilities)
- [Token-berekningsmodell for bilete](#token-berekningsmodell-for-bilete)
- [Native vs. External Vision Integration](#native-vs-external-vision-integration)
- [Performance og Latency-optimalisering](#performance-og-latency-optimalisering)
- [Brukstilfelle for norsk offentleg sektor](#brukstilfelle-for-norsk-offentleg-sektor)
- [Avgrensingar og kjende utfordringar](#avgrensingar-og-kjende-utfordringar)
- [For Cosmo](#for-cosmo)
## Introduksjon
GPT-4o (Omni) representerer en fundamental endring i korleis multimodale AI-modellar fungerer. I motsetnad til tidlegare tilnærmingar der tekst- og bildeforståing var separate modellar kopla saman, integrerer GPT-4o tekst og bilete i ein enkelt modell. Dette gir lågare latency, betre kontekstuell forståing og meir nøyaktige svar som kombinerer visuell og tekstuell informasjon.

View file

@ -3,9 +3,22 @@
**Last updated:** 2026-02
**Status:** GA
**Category:** Multi-Modal AI
**Type:** reference
---
## Innhold
- [Introduksjon](#introduksjon)
- [Kjernekomponentar](#kjernekomponentar)
- [Pre-trained Model Selection](#pre-trained-model-selection)
- [Custom Model Training og Evaluation](#custom-model-training-og-evaluation)
- [Confidence og Uncertainty Quantification](#confidence-og-uncertainty-quantification)
- [Real-time og Batch Processing](#real-time-og-batch-processing)
- [Norsk offentleg sektor](#norsk-offentleg-sektor)
- [Beslutningsrammeverk](#beslutningsrammeverk)
- [For Cosmo](#for-cosmo)
## Introduksjon
Bildeklassifisering og -forståing i Microsoft-stakken spenner frå tradisjonelle computer vision-modellar til moderne multimodale LLM-ar. Azure AI Vision 4.0, bygd på Florence foundation-modellen, tilbyr automatisk tagging, captioning, objektdeteksjon og OCR i ein samla API. For scenario som krev tilpassa kategoriar, finst Custom Vision (planlagd pensjonering 2028), Azure Machine Learning AutoML og Azure Content Understanding.

View file

@ -3,9 +3,23 @@
**Last updated:** 2026-02
**Status:** GA / Preview (varies by feature)
**Category:** Multi-Modal AI
**Type:** reference
---
## Innhold
- [Introduksjon](#introduksjon)
- [Kjernekomponentar](#kjernekomponentar)
- [Text, Image og Audio Harm Categories](#text-image-og-audio-harm-categories)
- [Multi-modal Prompt Injection Detection](#multi-modal-prompt-injection-detection)
- [Bias Detection Across Modalities](#bias-detection-across-modalities)
- [Regulatory Compliance og Audit Logging](#regulatory-compliance-og-audit-logging)
- [Implementeringsmønstre](#implementeringsmønstre)
- [Norsk offentleg sektor](#norsk-offentleg-sektor)
- [Beslutningsrammeverk](#beslutningsrammeverk)
- [For Cosmo](#for-cosmo)
## Introduksjon
Azure AI Content Safety tilbyr eit samla rammeverk for å detektere og filtrere skadeleg innhald på tvers av tekst, bilete, multimodalt innhald (bilete + tekst) og AI-generert output. Tenesta klassifiserer innhald i fire hovudkategoriar — Hate, Sexual, Violence og Self-Harm — med alvorlegheitsgradar frå 0 (trygt) til 6 (svært alvorleg).

View file

@ -3,9 +3,23 @@
**Last updated:** 2026-02
**Status:** GA
**Category:** Multi-Modal AI
**Type:** reference
---
## Innhold
- [Introduksjon](#introduksjon)
- [Kjernekomponentar](#kjernekomponentar)
- [Text Generation Metrics](#text-generation-metrics)
- [Image Quality og Relevance Metrics](#image-quality-og-relevance-metrics)
- [Cross-Modal Alignment Measurement](#cross-modal-alignment-measurement)
- [User Satisfaction og Business KPIs](#user-satisfaction-og-business-kpis)
- [Implementeringsmønstre](#implementeringsmønstre)
- [Norsk offentleg sektor](#norsk-offentleg-sektor)
- [Beslutningsrammeverk](#beslutningsrammeverk)
- [For Cosmo](#for-cosmo)
## Introduksjon
Evaluering av multi-modale AI-system er fundamentalt meir komplekst enn evaluering av rein tekst-AI. Når system kombinerer tekst, bilete, tale og video, treng ein metrikkrammeverk som dekker kvaliteten innanfor kvar modalitet, men også korleis modalitetane samhandlar — det som blir kalla cross-modal alignment. Microsoft Foundry og Azure OpenAI Evaluation API gir innebygd støtte for både NLP-baserte metrikktypar (BLEU, ROUGE, cosine similarity) og AI-assistert evaluering (groundedness, relevance, coherence, fluency).

View file

@ -3,9 +3,23 @@
**Last updated:** 2026-02
**Status:** GA
**Category:** Multi-Modal AI
**Type:** reference
---
## Innhold
- [Introduksjon](#introduksjon)
- [Kjernekomponentar](#kjernekomponentar)
- [Visual Grounding og Spatial Reasoning i Prompts](#visual-grounding-og-spatial-reasoning-i-prompts)
- [Few-shot Examples with Images](#few-shot-examples-with-images)
- [Chain-of-Thought Reasoning with Visuals](#chain-of-thought-reasoning-with-visuals)
- [System Messages for Multi-Modal Tasks](#system-messages-for-multi-modal-tasks)
- [Image Tokenization og Kostnadsoptimalisering](#image-tokenization-og-kostnadsoptimalisering)
- [Norsk offentleg sektor](#norsk-offentleg-sektor)
- [Beslutningsrammeverk](#beslutningsrammeverk)
- [For Cosmo](#for-cosmo)
## Introduksjon
Multimodal prompt engineering er kunsten å skrive effektive instruksjonar som kombinerer tekst og bilete for å utnytte kapabilitetane til vision-enabled modellar som GPT-4o, GPT-4o mini og GPT-4 Turbo with Vision. Desse modellane aksepterer både tekst og bilete som input, og kan utføre oppgåver som bildeanalyse, visuelt resonnement, dokumentforståing og diagramtolking.

View file

@ -3,9 +3,20 @@
**Last updated:** 2026-02
**Status:** GA / Preview (multimodal search)
**Category:** Multi-Modal AI
**Type:** reference
---
## Innhold
- [Introduksjon](#introduksjon)
- [Multi-Modal Embedding-modellar](#multi-modal-embedding-modellar)
- [Chunking-strategiar for bilete og video](#chunking-strategiar-for-bilete-og-video)
- [Vector Store Design for Mixed Media](#vector-store-design-for-mixed-media)
- [Retrieval og Ranking Patterns](#retrieval-og-ranking-patterns)
- [End-to-End Pipeline med Azure AI Search](#end-to-end-pipeline-med-azure-ai-search)
- [For Cosmo](#for-cosmo)
## Introduksjon
Multi-Modal RAG (Retrieval-Augmented Generation) utvidar tradisjonell tekstbasert RAG til å inkludere bilete, diagram, tabellar og video som datakjelder. I staden for å berre søke i tekstdokument, kan ein multi-modal RAG-pipeline hente relevante bilete, analysere diagram og bruke visuell informasjon saman med tekst for å generere presise og grunnlagda svar.

View file

@ -3,9 +3,22 @@
**Last updated:** 2026-02
**Status:** GA
**Category:** Multi-Modal AI
**Type:** reference
---
## Innhold
- [Introduksjon](#introduksjon)
- [Kjernekomponentar](#kjernekomponentar)
- [Image Preprocessing og Quality Assessment](#image-preprocessing-og-quality-assessment)
- [OCR Engine Selection og Configuration](#ocr-engine-selection-og-configuration)
- [Text Normalization og Correction](#text-normalization-og-correction)
- [Integration with Document Understanding](#integration-with-document-understanding)
- [Norsk offentleg sektor](#norsk-offentleg-sektor)
- [Beslutningsrammeverk](#beslutningsrammeverk)
- [For Cosmo](#for-cosmo)
## Introduksjon
Optical Character Recognition (OCR) er ein grunnleggjande kapabilitet for digitalisering av offentleg forvaltning. Microsoft tilbyr to hovudtenester for OCR: **Azure AI Document Intelligence** (tidlegare Form Recognizer) som er optimalisert for dokument med høg oppløysing, og **Azure AI Vision Image Analysis** (Read API) som er optimalisert for generelle bilete som skiltar, plakatar og scena-tekst.

View file

@ -3,9 +3,23 @@
**Last updated:** 2026-02
**Status:** GA
**Category:** Multi-Modal AI
**Type:** reference
---
## Innhold
- [Introduksjon](#introduksjon)
- [Kjernekomponentar](#kjernekomponentar)
- [Støtta modellar](#støtta-modellar)
- [Session Management og State Tracking](#session-management-og-state-tracking)
- [Audio Codec-val og bandbreiddeoptimalisering](#audio-codec-val-og-bandbreiddeoptimalisering)
- [Interruption og Turn-Taking](#interruption-og-turn-taking)
- [Deployment og Scaling Patterns](#deployment-og-scaling-patterns)
- [Norsk offentleg sektor](#norsk-offentleg-sektor)
- [Beslutningsrammeverk](#beslutningsrammeverk)
- [For Cosmo](#for-cosmo)
## Introduksjon
Azure OpenAI GPT Realtime API er ein del av GPT-4o-modellfamilien som støttar låg-latency "speech in, speech out" samtaleinteraksjonar. API-et er designa for sanntids bruksscenario som kundeserviceagentar, taleassistentar og sanntidstolkar, der rask respons er kritisk for brukaropplevinga.

View file

@ -3,9 +3,20 @@
**Last updated:** 2026-02
**Status:** GA
**Category:** Multi-Modal AI
**Type:** reference
---
## Innhold
- [Introduksjon](#introduksjon)
- [Speech Recognition og Language Detection](#speech-recognition-og-language-detection)
- [Audio Preprocessing og Quality Assessment](#audio-preprocessing-og-quality-assessment)
- [Low-Latency Streaming Architectures](#low-latency-streaming-architectures)
- [Error Handling og Confidence Scoring](#error-handling-og-confidence-scoring)
- [Pipeline-arkitekturar for norsk offentleg sektor](#pipeline-arkitekturar-for-norsk-offentleg-sektor)
- [For Cosmo](#for-cosmo)
## Introduksjon
Speech-to-AI-integrasjon handlar om å kople talegjenkjenning med downstream AI-tenester for å skape ende-til-ende-pipelines som konverterer tale til handlingsorienterte innsikter. Azure Speech Service dannar grunnlaget, med støtte for sanntids talegjenkjenning, batchtranskribering, språkdeteksjon, talardiarisering og tilpassa talemodular.

View file

@ -3,9 +3,23 @@
**Last updated:** 2026-02
**Status:** GA
**Category:** Multi-Modal AI
**Type:** reference
---
## Innhold
- [Introduksjon](#introduksjon)
- [Kjernekomponentar](#kjernekomponentar)
- [Neural Voice Selection og Customization](#neural-voice-selection-og-customization)
- [SSML Markup for Prosody Control](#ssml-markup-for-prosody-control)
- [Multi-lingual Citizen Support](#multi-lingual-citizen-support)
- [Performance og Cost Optimization](#performance-og-cost-optimization)
- [Implementeringsmønstre](#implementeringsmønstre)
- [Norsk offentleg sektor](#norsk-offentleg-sektor)
- [Beslutningsrammeverk](#beslutningsrammeverk)
- [For Cosmo](#for-cosmo)
## Introduksjon
Azure Speech Services Text-to-Speech (TTS) gir offentleg sektor moglegheit til å tilby tilgjengelege, talbaserte digitale tenester for alle innbyggjarar. Med over 400 neurale stemmer på meir enn 140 språk og lokalarar — inkludert norsk bokmål (`nb-NO`) med stemmene PernilleNeural, FinnNeural og IselinNeural — kan etatar levere informasjon auditivt til brukarar med synshemming, lesevanskar eller låg digital kompetanse.

View file

@ -3,9 +3,22 @@
**Last updated:** 2026-02
**Status:** GA
**Category:** Multi-Modal AI
**Type:** reference
---
## Innhold
- [Introduksjon](#introduksjon)
- [Kjernekomponentar](#kjernekomponentar)
- [Scene- og Action Detection](#scene--og-action-detection)
- [Temporal Understanding og Summarization](#temporal-understanding-og-summarization)
- [Multi-Frame Analysis Strategies](#multi-frame-analysis-strategies)
- [Integrasjon med Narrative Understanding](#integrasjon-med-narrative-understanding)
- [Norsk offentleg sektor](#norsk-offentleg-sektor)
- [Beslutningsrammeverk](#beslutningsrammeverk)
- [For Cosmo](#for-cosmo)
## Introduksjon
Videoanalyse og -forståing på Azure-plattforma kombinerer Azure AI Video Indexer sin spesialiserte videoanalyse med generative AI-modellar som GPT-4o for djupare semantisk forståing. Video Indexer ekstraherer over 30 ulike typar innsikt frå video — inkludert scenedeteksjon, talegjenkjenning, emosjonanalyse, OCR, ansiktsgjenkjenning og objektdeteksjon — medan GPT-4o sine visuelle kapabilitetar opnar for fri-form analyse av enkeltbilete og keyframes.

View file

@ -3,9 +3,24 @@
**Last updated:** 2026-02
**Status:** GA
**Category:** Multi-Modal AI
**Type:** reference
---
## Innhold
- [Introduksjon](#introduksjon)
- [Kjernekomponentar](#kjernekomponentar)
- [Whisper Model Selection](#whisper-model-selection)
- [Fleirspråkleg og norsk støtte](#fleirspråkleg-og-norsk-støtte)
- [Speaker Diarization og Identification](#speaker-diarization-og-identification)
- [Custom Vocabularies og Fine-Tuning](#custom-vocabularies-og-fine-tuning)
- [Batch Transcription for store filer](#batch-transcription-for-store-filer)
- [Implementeringsmønstre](#implementeringsmønstre)
- [Norsk offentleg sektor](#norsk-offentleg-sektor)
- [Beslutningsrammeverk](#beslutningsrammeverk)
- [For Cosmo](#for-cosmo)
## Introduksjon
OpenAI Whisper er ein generell talegjenkjenningsmodell (Automatic Speech Recognition, ASR) som utmerkar seg på fleirspråkleg talegjenkjenning, taleoversetting og språkidentifisering. Modellen er trena på eit massivt datasett med variert audio, noko som gir robust handtering av ulike språk, aksentar og talevariantar. Whisper er tilgjengeleg både gjennom Azure OpenAI Service og som ein del av Azure AI Speech Service.