refactor(examples): replace sector-specific example material with generic, fictitious examples
Reference files, test fixtures, the playground demo project and one design document now use generic, fictitious examples (buildings, energy, water, grants, municipal services). The playground demo (17 fixtures plus the embedded demo state) tells one consistent story: a municipal customer chatbot that pre-screens housing-benefit applications, classified under Annex III point 5(a). The embedded demo copies were edited in place rather than regenerated, because they already carry newer AI Act dates than the fixture files. Legal text is unchanged. Test semantics are unchanged. Four dark-theme onboarding screenshots with outdated placeholder text are removed. Co-Authored-By: Claude Opus 5.5 <noreply@anthropic.com>
This commit is contained in:
parent
ced0c5f46d
commit
544934dc57
77 changed files with 363 additions and 368 deletions
|
|
@ -230,8 +230,8 @@ Video Indexer brukar tre ontologiar for emneinferens:
|
|||
"topics": [
|
||||
{
|
||||
"id": 1,
|
||||
"name": "Vegtrafikk",
|
||||
"referenceId": "Transport/Vegtrafikk",
|
||||
"name": "Energi",
|
||||
"referenceId": "Miljø/Energi",
|
||||
"referenceType": "VideoIndexer",
|
||||
"confidence": 0.89,
|
||||
"language": "nb-NO",
|
||||
|
|
|
|||
|
|
@ -26,7 +26,7 @@ Integrasjonen av spesialiserte computer vision (CV) modellar med large language
|
|||
|
||||
Azure-plattforma gir eit rikt økosystem for dette: Azure AI Vision for spesialisert bildeanalyse (OCR, objektdeteksjon, multimodal embeddings), Azure OpenAI for GPT-4o og GPT-4.1 sine vision-kapabilitetar, Microsoft Foundry for modellfinetuning og deployment, og Phi-4-multimodal-instruct som ein kostnadseffektiv open-source-modell for edge-scenario. Florence-2-modellen frå Microsoft er eit anna sterkt alternativ for spesialiserte vision-oppgåver.
|
||||
|
||||
For norsk offentleg sektor er denne integrasjonen relevant for byggesaksbehandling (analyse av arkitektteikningar), veginfrastruktur (skadevurdering frå bilete), helsevesen (medisinsk bildeanalyse), og kulturarv (digitalisering og klassifisering av museumsgjenstandar). Nøkkelen er å kombinere rette verktøy for rette oppgåver — bruk spesialiserte CV-modellar for presis ekstraksjon og LLMs for tolking og resonnering.
|
||||
For norsk offentleg sektor er denne integrasjonen relevant for byggesaksbehandling (analyse av arkitektteikningar), eigedomsforvaltning (skadevurdering frå bilete), helsevesen (medisinsk bildeanalyse), og kulturarv (digitalisering og klassifisering av museumsgjenstandar). Nøkkelen er å kombinere rette verktøy for rette oppgåver — bruk spesialiserte CV-modellar for presis ekstraksjon og LLMs for tolking og resonnering.
|
||||
|
||||
---
|
||||
|
||||
|
|
@ -65,14 +65,14 @@ training_example = {
|
|||
"messages": [
|
||||
{
|
||||
"role": "system",
|
||||
"content": "Du er ein ekspert på analyse av norske vegskilt."
|
||||
"content": "Du er ein ekspert på identifisering av norske planteartar."
|
||||
},
|
||||
{
|
||||
"role": "user",
|
||||
"content": [
|
||||
{
|
||||
"type": "text",
|
||||
"text": "Identifiser og klassifiser skiltet i biletet."
|
||||
"text": "Identifiser og klassifiser planta i biletet."
|
||||
},
|
||||
{
|
||||
"type": "image_url",
|
||||
|
|
@ -84,8 +84,8 @@ training_example = {
|
|||
},
|
||||
{
|
||||
"role": "assistant",
|
||||
"content": "Skiltet er eit fartsgrenseskilt som viser 80 km/t. "
|
||||
"Type: Forbudsskilt (skilt 362). Tilstand: God."
|
||||
"content": "Planta er hundekjeks (Anthriscus sylvestris). "
|
||||
"Familie: Skjermplantefamilien. Tilstand: Blomstrande."
|
||||
}
|
||||
]
|
||||
}
|
||||
|
|
@ -415,7 +415,7 @@ Bruk Phi-4 på edge for rask triagering, send berre komplekse tilfelle til cloud
|
|||
|
||||
### Bruksscenario
|
||||
|
||||
- **Direktoratetet**: Analyse av vegdekkeskade frå inspeksjonsbilete
|
||||
- **Eigedomsforvaltar**: Analyse av fasadeskade frå inspeksjonsbilete
|
||||
- **Kartverket**: Klassifisering av satellittbilete og kartdata
|
||||
- **Kulturminnevern**: Digital katalogisering av kulturminne
|
||||
- **Helsesektoren**: Analyse av røntgen/MR med AI-assistanse (medisinsk produkt-regulering)
|
||||
|
|
@ -449,6 +449,6 @@ Bruk Phi-4 på edge for rask triagering, send berre komplekse tilfelle til cloud
|
|||
|
||||
- **Cascade-mønsteret** (Azure AI Vision først, GPT-4o for komplekse tilfelle) reduserer kostnad med 60-80% — bruk Vision for filtrering/kategorisering og GPT-4o berre for det som krev resonnering
|
||||
- **Vision fine-tuning av GPT-4o** (2024-08-06) gir domene-spesialisering — men Azure filtrerer automatisk ut bilete med personar/ansikt frå treningsdata, noko som avgrensar bruksområdet
|
||||
- **Phi-4-multimodal-instruct** med Student-Teacher fine-tuning frå GPT-4o gir edge-kapabel vision AI — relevant for Direktoratetet sin inspeksjonsinfrastruktur og andre offline-scenario
|
||||
- **Phi-4-multimodal-instruct** med Student-Teacher fine-tuning frå GPT-4o gir edge-kapabel vision AI — relevant for inspeksjon i felt og andre offline-scenario
|
||||
- **Few-shot visual learning** med GPT-4o krev berre 3-5 eksempelbilete for ny klassifiseringsoppgåve — bruk `detail: "low"` på eksempel (85 tokens) og `detail: "high"` på target for å optimalisere kostnad
|
||||
- **Multimodal embeddings** (Azure AI Vision v4.0) støttar 102 språk og muliggjer semantisk bildesøk — bruk for å bygge søkbare bildearkiv i offentleg sektor
|
||||
|
|
|
|||
|
|
@ -330,11 +330,11 @@ def create_public_sector_prompt(context: str, style: str = "informativ") -> str:
|
|||
|
||||
return f"{base_prompts.get(style, base_prompts['informativ'])}{context}"
|
||||
|
||||
# Eksempel: Generer illustrasjon for vegsikkerheit
|
||||
# Eksempel: Generer illustrasjon for brannførebygging
|
||||
prompt = create_public_sector_prompt(
|
||||
"Illustrer konseptet med nullvisjon for trafikksikkerheit. "
|
||||
"Vis ein trygg veg med fotgjengarfelt, sykkelsti og bil "
|
||||
"i ein moderne norsk bysamanheng med fjell i bakgrunnen.",
|
||||
"Illustrer konseptet med brannsikker heim. "
|
||||
"Vis ei stove med røykvarslar, brannslokkingsapparat og merkt nødutgang "
|
||||
"i ein moderne norsk bustad med fjell utanfor vindauget.",
|
||||
style="informativ"
|
||||
)
|
||||
```
|
||||
|
|
|
|||
|
|
@ -329,7 +329,7 @@ async def analyze_image_cached(image_data: bytes, prompt: str, cache_client):
|
|||
|----------|--------------|-----------|
|
||||
| Byggesøknad med teikningar | `high` | Ekstraher mål, material, plassering |
|
||||
| Passfoto-validering | `low` | Grunnleggjande kvalitetssjekk (ansiktsblurring aktiv) |
|
||||
| Vegskilt-inventering | `high` | Klassifisering og tilstandsvurdering |
|
||||
| Inventarregistrering | `high` | Klassifisering og tilstandsvurdering |
|
||||
| Kartanalyse | `high` | Identifiser markerte område, målestokk |
|
||||
| Fakturabehandling | `high` | Kombiner med Document Intelligence |
|
||||
|
||||
|
|
@ -368,5 +368,5 @@ Gje ein strukturert vurdering i JSON-format.
|
|||
- **GPT-4o vision brukar ein to-nivå token-modell:** `low` (flat 85 tokens) vs. `high` (tile-basert, 170 tokens per 512x512 tile + 85 base). Alltid berekn token-kostnad før du designar ein pipeline med mange bilete.
|
||||
- **Ansiktsblurring er automatisk i Azure OpenAI** og kan ikkje deaktiverast for GPT-4o. Dette er ein fordel for norsk personvern, men avgrensar brukstilfelle som ansiktsbasert identifisering.
|
||||
- **Kombiner native vision med Azure Document Intelligence** for strukturert dokumentanalyse. GPT-4o gir generell forståing; Document Intelligence gir presis feltekstraksjon.
|
||||
- **Vision fine-tuning er tilgjengeleg for GPT-4o (2024-08-06)** og kan forbetrast for spesifikke domene som norske byggesøknadar eller vegskilt. Merk at bilete med personar blir filtrert ut.
|
||||
- **Vision fine-tuning er tilgjengeleg for GPT-4o (2024-08-06)** og kan forbetrast for spesifikke domene som norske byggesøknadar eller kartsymbol. Merk at bilete med personar blir filtrert ut.
|
||||
- **For kostnadsoptimalisering, bruk `detail: auto`** som standard og `low` for screeing/klassifisering. Reservar `high` for tilfelle der detaljar er kritiske.
|
||||
|
|
|
|||
|
|
@ -60,7 +60,7 @@ client = ImageAnalysisClient(
|
|||
|
||||
# Analyser bilete med alle tilgjengelege features
|
||||
result = client.analyze_from_url(
|
||||
image_url="https://example.com/road-damage.jpg",
|
||||
image_url="https://example.com/facade-damage.jpg",
|
||||
visual_features=[
|
||||
VisualFeatures.CAPTION,
|
||||
VisualFeatures.DENSE_CAPTIONS,
|
||||
|
|
@ -122,12 +122,12 @@ response = client.chat.completions.create(
|
|||
{
|
||||
"role": "system",
|
||||
"content": """Du er ein bildeklassifiseringsekspert for
|
||||
Direktoratet for digital tjenesteutvikling. Klassifiser vegskader i kategoriane:
|
||||
- SPREKK_LANGSGAAANDE
|
||||
- SPREKK_TVERRGAAANDE
|
||||
- HULLROT
|
||||
- SETNINGSSKADE
|
||||
- KANTSKADE
|
||||
Direktoratet for digital tjenesteutvikling. Klassifiser bygningsskader i kategoriane:
|
||||
- SPREKK_I_MUR
|
||||
- FUKTSKADE
|
||||
- AVSKALLING
|
||||
- ROTSKADE
|
||||
- TAKSKADE
|
||||
- INGEN_SKADE
|
||||
Returner JSON med 'kategori', 'alvorlegheit' (1-5),
|
||||
og 'forklaring'."""
|
||||
|
|
@ -135,11 +135,11 @@ response = client.chat.completions.create(
|
|||
{
|
||||
"role": "user",
|
||||
"content": [
|
||||
{"type": "text", "text": "Klassifiser denne vegskaden:"},
|
||||
{"type": "text", "text": "Klassifiser denne bygningsskaden:"},
|
||||
{
|
||||
"type": "image_url",
|
||||
"image_url": {
|
||||
"url": "https://example.com/road-image.jpg",
|
||||
"url": "https://example.com/facade-image.jpg",
|
||||
"detail": "high"
|
||||
}
|
||||
}
|
||||
|
|
@ -172,7 +172,7 @@ ml_client = MLClient(
|
|||
|
||||
# Definer AutoML image classification job
|
||||
job = ImageClassificationJob(
|
||||
experiment_name="road-damage-classification",
|
||||
experiment_name="facade-damage-classification",
|
||||
training_data=training_dataset,
|
||||
validation_data=validation_dataset,
|
||||
target_column_name="label",
|
||||
|
|
@ -203,8 +203,8 @@ client = ContentUnderstandingClient(
|
|||
|
||||
# Analyser bilete med tilpassa schema
|
||||
poller = client.begin_analyze(
|
||||
analyzer_id="custom-road-damage",
|
||||
inputs=[{"url": "https://example.com/road.jpg"}]
|
||||
analyzer_id="custom-facade-damage",
|
||||
inputs=[{"url": "https://example.com/building.jpg"}]
|
||||
)
|
||||
result = poller.result()
|
||||
```
|
||||
|
|
@ -319,7 +319,7 @@ Azure Blob Storage (bileter)
|
|||
|
||||
### Relevante bruksområde
|
||||
|
||||
- **Vegforvaltning**: Automatisk klassifisering av vegskader frå dronefoto
|
||||
- **Eigedomsforvaltning**: Automatisk klassifisering av bygningsskader frå dronefoto
|
||||
- **Byggesak**: Bildeanalyse av byggeprosjekt for samsvar med reguleringsplanar
|
||||
- **Naturovervaking**: Klassifisering av vegetasjon, dyreliv og miljøtilstand
|
||||
- **Kulturarv**: Kategorisering og tilstandsvurdering av kulturminne
|
||||
|
|
@ -335,7 +335,7 @@ Azure Blob Storage (bileter)
|
|||
### Bias-vurdering
|
||||
|
||||
- Florence-modellen er trent på breie datasett, men kan ha geografisk bias
|
||||
- Norske skiltar, vegmerking og infrastruktur kan krevje finjustering
|
||||
- Norske byggeskikkar, materialar og klimaskadar kan krevje finjustering
|
||||
- Anbefaling: Evaluer alltid med norsk-spesifikt testdatasett
|
||||
|
||||
---
|
||||
|
|
|
|||
|
|
@ -24,7 +24,7 @@
|
|||
|
||||
Multimodal prompt engineering er kunsten å skrive effektive instruksjonar som kombinerer tekst og bilete for å utnytte kapabilitetane til vision-enabled modellar som GPT-4o, GPT-4o mini og GPT-4 Turbo with Vision. Desse modellane aksepterer både tekst og bilete som input, og kan utføre oppgåver som bildeanalyse, visuelt resonnement, dokumentforståing og diagramtolking.
|
||||
|
||||
Microsoft sin offisielle rettleiing for image prompt engineering identifiserer seks grunnprinsipp: kontekstuell spesifisitet, oppgåveorienterte prompts, handtering av nekting (refusals), eksempelbruk, oppdeling av komplekse oppgåver, og definering av output-format. Desse prinsippa er like relevante for norsk offentleg sektor, der multimodale modellar kan nyttast til alt frå byggesaksanalyse til kvalitetssikring av veginfrastruktur.
|
||||
Microsoft sin offisielle rettleiing for image prompt engineering identifiserer seks grunnprinsipp: kontekstuell spesifisitet, oppgåveorienterte prompts, handtering av nekting (refusals), eksempelbruk, oppdeling av komplekse oppgåver, og definering av output-format. Desse prinsippa er like relevante for norsk offentleg sektor, der multimodale modellar kan nyttast til alt frå byggesaksanalyse til tilstandsvurdering av offentlege bygg.
|
||||
|
||||
Microsoft Foundry Playground tilbyr eit interaktivt miljø for å eksperimentere med multimodale prompts, og GPT-4o sin image tokenization-mekanisme påverkar både kostnader og ytelse. Forståing av korleis bilete vert konvertert til tokens er kritisk for kostnadsoptimalisering i produksjonssystem.
|
||||
|
||||
|
|
@ -71,13 +71,13 @@ response = client.chat.completions.create(
|
|||
messages=[
|
||||
{
|
||||
"role": "system",
|
||||
"content": """Du er ein vegingeniør-assistent. Analyser
|
||||
biletet av vegkrysset og beskriv:
|
||||
"content": """Du er ein arealplanleggjar-assistent. Analyser
|
||||
biletet av bustadfeltet og beskriv:
|
||||
1. Kva som er i NORD (øvst i biletet)
|
||||
2. Kva som er i SØR (nedst)
|
||||
3. Kva som er i ØST (høgre)
|
||||
4. Kva som er i VEST (venstre)
|
||||
5. Eventuelle trafikkproblem du observerer
|
||||
5. Eventuelle arealkonfliktar du observerer
|
||||
Returner som strukturert JSON."""
|
||||
},
|
||||
{
|
||||
|
|
@ -85,12 +85,12 @@ response = client.chat.completions.create(
|
|||
"content": [
|
||||
{
|
||||
"type": "text",
|
||||
"text": "Analyser dette vegkrysset for trafikkplanlegging:"
|
||||
"text": "Analyser dette bustadfeltet for arealplanlegging:"
|
||||
},
|
||||
{
|
||||
"type": "image_url",
|
||||
"image_url": {
|
||||
"url": "https://example.com/intersection.jpg",
|
||||
"url": "https://example.com/site-plan.jpg",
|
||||
"detail": "high"
|
||||
}
|
||||
}
|
||||
|
|
@ -120,7 +120,7 @@ response = client.chat.completions.create(
|
|||
{
|
||||
"role": "user",
|
||||
"content": [
|
||||
{"type": "text", "text": "Identifiser alle trafikkskilt "
|
||||
{"type": "text", "text": "Identifiser alle nødutgangsskilt "
|
||||
"og deira posisjon i biletet."},
|
||||
{"type": "image_url", "image_url": {"url": image_url}}
|
||||
]
|
||||
|
|
@ -142,14 +142,14 @@ def classify_with_examples(target_image_url: str,
|
|||
Klassifiser med few-shot bilete-eksempel.
|
||||
|
||||
examples = [
|
||||
{"url": "...", "label": "HULLROT", "forklaring": "..."},
|
||||
{"url": "...", "label": "FUKTSKADE", "forklaring": "..."},
|
||||
{"url": "...", "label": "SPREKK", "forklaring": "..."},
|
||||
]
|
||||
"""
|
||||
messages = [
|
||||
{
|
||||
"role": "system",
|
||||
"content": "Du er ein vegskade-klassifiseringsekspert. "
|
||||
"content": "Du er ein bygningsskade-klassifiseringsekspert. "
|
||||
"Bruk dei gitte eksempla som referanse."
|
||||
}
|
||||
]
|
||||
|
|
@ -159,7 +159,7 @@ def classify_with_examples(target_image_url: str,
|
|||
messages.append({
|
||||
"role": "user",
|
||||
"content": [
|
||||
{"type": "text", "text": "Klassifiser denne vegskaden:"},
|
||||
{"type": "text", "text": "Klassifiser denne bygningsskaden:"},
|
||||
{"type": "image_url",
|
||||
"image_url": {"url": ex["url"], "detail": "low"}}
|
||||
]
|
||||
|
|
@ -174,7 +174,7 @@ def classify_with_examples(target_image_url: str,
|
|||
messages.append({
|
||||
"role": "user",
|
||||
"content": [
|
||||
{"type": "text", "text": "Klassifiser denne vegskaden:"},
|
||||
{"type": "text", "text": "Klassifiser denne bygningsskaden:"},
|
||||
{"type": "image_url",
|
||||
"image_url": {"url": target_image_url, "detail": "high"}}
|
||||
]
|
||||
|
|
@ -343,16 +343,16 @@ AVGRENSINGAR:
|
|||
- Ikkje gjett — be om tilleggsinformasjon om nødvendig
|
||||
"""
|
||||
|
||||
# Eksempel: Vegskade-vurdering
|
||||
# Eksempel: Bygningsskade-vurdering
|
||||
system_message = VISUAL_SYSTEM_TEMPLATE.format(
|
||||
rolle="Fagingeniør med 20 års erfaring frå norsk offentleg sektor",
|
||||
kontekst="Årlege fagvise inspeksjonar i Noreg",
|
||||
oppgåve="Vurder vegskade og anbefal vedlikehaldstiltak",
|
||||
oppgåve="Vurder bygningsskade og anbefal vedlikehaldstiltak",
|
||||
steg_for_steg_instruksjonar="""
|
||||
1. Identifiser skadetypen (sprekk, hullrot, setning, kantskade)
|
||||
1. Identifiser skadetypen (sprekk, fuktskade, avskalling, rotskade)
|
||||
2. Vurder alvorlegheit på skala 1-5
|
||||
3. Estimer utbreiing i m2
|
||||
4. Anbefal tiltak (lappearbeid, fresing, full omlegging)
|
||||
4. Anbefal tiltak (flekkreparasjon, utskifting, full rehabilitering)
|
||||
5. Prioriter (akutt, innan 3 mnd, neste sesong)""",
|
||||
format_spesifikasjon="""JSON med felt:
|
||||
{
|
||||
|
|
@ -373,7 +373,7 @@ system_message = VISUAL_SYSTEM_TEMPLATE.format(
|
|||
| Rolle | System message-fokus | Typisk output |
|
||||
|-------|---------------------|---------------|
|
||||
| Byggesak-konsulent | TEK17-samsvar, reguleringsplan | Avviksliste med referanse |
|
||||
| Vegingeniør | Skadeklassifisering, NVDB-kategori | Vedlikehaldsprioritering |
|
||||
| Bygningsingeniør | Skadeklassifisering, bygningsdel | Vedlikehaldsprioritering |
|
||||
| Kulturminne-rådgjevar | Tilstandsvurdering, freding | Tilstandsrapport |
|
||||
| Miljørådgjevar | Artsidentifisering, habitatvurdering | Konsekvensutgreiing |
|
||||
|
||||
|
|
@ -442,14 +442,14 @@ print(f"Estimerte tokens: {tokens}") # 85 + (170 * 6) = 1105
|
|||
|
||||
### Bruksområde for multimodal prompt engineering
|
||||
- **Byggesak**: Visuell vurdering av samsvar med reguleringsplanar
|
||||
- **Vegforvaltning**: Automatisk skadeklassifisering frå dronefoto
|
||||
- **Eigedomsforvaltning**: Automatisk skadeklassifisering frå dronefoto
|
||||
- **Kulturarv**: Tilstandsvurdering av kulturminne frå bilete
|
||||
- **Plan og kart**: Analyse av reguleringsplanar og kartutsnitt
|
||||
- **Miljø**: Artsidentifisering og habitatvurdering
|
||||
|
||||
### Prompt-design for norsk kontekst
|
||||
- Skriv system messages på norsk for domene-spesifikk terminologi
|
||||
- Referer til norske standardar (TEK17, NVDB, NS-EN-standardar)
|
||||
- Referer til norske standardar (TEK17, NS-EN-standardar)
|
||||
- Inkluder norske einskapar (NOK, m2, km/t)
|
||||
- Bruk norske stadnamn og referansar
|
||||
|
||||
|
|
|
|||
|
|
@ -23,7 +23,7 @@ Multi-Modal RAG (Retrieval-Augmented Generation) utvidar tradisjonell tekstbaser
|
|||
|
||||
Azure AI Search introduserte multimodal search som preview i mai 2025, noko som gir native støtte for å indeksere, forstå og hente dokument som inneheld både tekst og bilete. Dette eliminerer behovet for separate system for tekst- og bildeprosessering og reduserer kompleksiteten i RAG-arkitekturen vesentleg.
|
||||
|
||||
For norsk offentleg sektor er multi-modal RAG særleg verdifull for scenario som analyse av offentlege dokument med innebygde diagram og tabellar, byggesøknadar med teikningar, vegdokumentasjon med kartutsnitt, og forskingsrapportar med visualiseringar. Informasjon som tidlegare berre var tilgjengeleg som visuelt innhald i PDF-filer kan no søkast i og brukast som grunnlag for AI-assisterte avgjerder.
|
||||
For norsk offentleg sektor er multi-modal RAG særleg verdifull for scenario som analyse av offentlege dokument med innebygde diagram og tabellar, byggesøknadar med teikningar, arealplanar med kartutsnitt, og forskingsrapportar med visualiseringar. Informasjon som tidlegare berre var tilgjengeleg som visuelt innhald i PDF-filer kan no søkast i og brukast som grunnlag for AI-assisterte avgjerder.
|
||||
|
||||
---
|
||||
|
||||
|
|
@ -295,10 +295,10 @@ search_client = SearchClient(
|
|||
|
||||
# Hybrid søk: tekst + vektor + semantisk ranking
|
||||
results = search_client.search(
|
||||
search_text="trafikksikkerheit i tunneler",
|
||||
search_text="brannsikring i offentlege bygg",
|
||||
vector_queries=[
|
||||
VectorizableTextQuery(
|
||||
text="trafikksikkerheit i tunneler",
|
||||
text="brannsikring i offentlege bygg",
|
||||
k_nearest_neighbors=10,
|
||||
fields="text_vector,image_vector"
|
||||
)
|
||||
|
|
|
|||
|
|
@ -375,7 +375,7 @@ def estimate_realtime_cost(sessions_per_day, avg_duration_minutes):
|
|||
- **NAV kontaktsenter**: Automatisert talebasert rettleiing for ytingar og søknader
|
||||
- **Kommunale servicesentra**: 24/7 talebasert borgarservice
|
||||
- **Helsevesenet**: Triageringssamtalar med automatisk dokumentasjon
|
||||
- **Direktoratetet**: Talebasert rettleiing for førarkort og køyretøytenester
|
||||
- **Skatteetaten**: Talebasert rettleiing for skattekort og skattemelding
|
||||
|
||||
### Regulatoriske krav
|
||||
|
||||
|
|
|
|||
|
|
@ -93,14 +93,14 @@ For norsk offentleg sektor med spesialisert terminologi:
|
|||
| Tilpasning | Brukstilfelle | Eksempel |
|
||||
|-----------|--------------|---------|
|
||||
| **Phrase list** | Forbetra gjenkjenning av spesifikke ord | Stadnamn, fagtermar |
|
||||
| **Custom model** | Trenar ny modell med eigne data | Vegsektoren, helsesektor |
|
||||
| **Custom model** | Trenar ny modell med eigne data | Energisektoren, helsesektor |
|
||||
| **Display format** | Tilpass visning av gjenkjend tekst | Tal-til-siffer, dato-format |
|
||||
|
||||
```python
|
||||
# Phrase list for forbetra norsk gjenkjenning
|
||||
phrase_list = speechsdk.PhraseListGrammar.from_recognizer(speech_recognizer)
|
||||
phrase_list.addPhrase("Direktoratet for digital tjenesteutvikling")
|
||||
phrase_list.addPhrase("E6 Megården-Mørsvikbotn")
|
||||
phrase_list.addPhrase("Lofotodden nasjonalpark")
|
||||
phrase_list.addPhrase("Utredningsinstruksen")
|
||||
phrase_list.addPhrase("Forvaltningsloven")
|
||||
phrase_list.addPhrase("personvernforordningen")
|
||||
|
|
@ -217,9 +217,9 @@ class AudioPreprocessor:
|
|||
Mikrofon → Audio stream → Azure Speech SDK
|
||||
↓
|
||||
┌── Recognizing event (interim)
|
||||
│ "Eg trur at veg..."
|
||||
│ "Eg trur at helse..."
|
||||
├── Recognized event (final)
|
||||
│ "Eg trur at vegsektoren bør investere meir."
|
||||
│ "Eg trur at helsesektoren bør investere meir."
|
||||
│ Offset: 1800000 ticks
|
||||
│ Duration: 30500000 ticks
|
||||
└── SessionStopped event
|
||||
|
|
|
|||
|
|
@ -25,7 +25,7 @@ Videoanalyse og -forståing på Azure-plattforma kombinerer Azure AI Video Index
|
|||
|
||||
For norsk offentleg sektor er videoanalyse relevant for fleire bruksområde: analyse av overvakingsvideo for Direktoratet for digital tjenesteutvikling, transkripsjon og søk i offentlege høyringar for Stortinget, tilgjengelegheitsanalyse av offentleg video, og automatisert kvalitetskontroll av opplæringsvideo. Azure Video Indexer støttar norsk tale-til-tekst og kan oversette til 50+ språk.
|
||||
|
||||
Azure AI Video Indexer tilbyr også real-time videoanalyse (preview) via Azure Arc-enabled infrastruktur, som mogleggjer sanntidsanalyse av livevideo ved kanten — relevant for trafikkmonitorering og smart byinfrastruktur.
|
||||
Azure AI Video Indexer tilbyr også real-time videoanalyse (preview) via Azure Arc-enabled infrastruktur, som mogleggjer sanntidsanalyse av livevideo ved kanten — relevant for anleggsovervaking og smart byinfrastruktur.
|
||||
|
||||
---
|
||||
|
||||
|
|
@ -343,7 +343,7 @@ Video Indexer ekstraherer rike audio-innsikter:
|
|||
|
||||
### Bruksscenario
|
||||
|
||||
- **Direktoratet for digital tjenesteutvikling**: Trafikkvideoanalyse for hendingsdeteksjon og trafikkflyt
|
||||
- **Direktoratet for digital tjenesteutvikling**: Søkbar indeksering av opplæringsvideoar
|
||||
- **Stortinget**: Søkbar indeksering av høyringar og debattar
|
||||
- **NRK**: Automatisk underteksting og innhaldsklassifisering
|
||||
- **Kommunar**: Analyse av bystyremøte med talar-identifisering
|
||||
|
|
@ -375,7 +375,7 @@ For bruksscenario som krev sanntidsanalyse utan skyavhengigheit:
|
|||
|----------|------------|-------------|
|
||||
| Søkbar videoarkivering | Video Indexer Standard preset | Transkripsjon + nøkkelord + scener |
|
||||
| Detaljert innhaldsanalyse | Video Indexer Advanced + GPT-4o | Full analyse + semantisk forståing |
|
||||
| Sanntids trafikkmonitorering | Video Indexer on Arc | Edge-basert, låg latency |
|
||||
| Sanntids anleggsovervaking | Video Indexer on Arc | Edge-basert, låg latency |
|
||||
| Videotilgjengelegheit | Video Indexer + Azure Speech TTS | Undertekstar + lydbeskrivingar |
|
||||
| Enkel persondeteksjon | Azure AI Vision Spatial Analysis | Lågare kostnad for basisk analyse |
|
||||
| Narrativ videoforståing | Keyframe sampling + GPT-4o | Temporal kontekst + semantikk |
|
||||
|
|
@ -387,5 +387,5 @@ For bruksscenario som krev sanntidsanalyse utan skyavhengigheit:
|
|||
- **Azure AI Video Indexer** gir 30+ innsiktstypar i ein enkelt API — bruk Standard preset for dei fleste bruksscenario, Advanced for full analyse med kledningsdeteksjon og audioeffektar
|
||||
- **Scene → Shot → Keyframe-hierarkiet** er fundamentalt for temporal forståing — scener er semantiske einingar, shots er kamera-einingar, keyframes er representative stillbilete
|
||||
- **GPT-4o keyframe analysis** utfyller Video Indexer for djupare semantisk forståing — send 5-10 keyframes med kontekst for narrativ analyse av videoinnhald
|
||||
- **Real-time Video Indexer on Arc** (preview) mogleggjer edge-basert sanntidsanalyse — relevant for trafikkmonitorering og smart byinfrastruktur i norsk offentleg sektor
|
||||
- **Real-time Video Indexer on Arc** (preview) mogleggjer edge-basert sanntidsanalyse — relevant for anleggsovervaking og smart byinfrastruktur i norsk offentleg sektor
|
||||
- **Audio insights** (emosjonar, nøkkelord, talarar) kombinert med visuelle innsikter gir heilskapleg videoforståing — bruk dette for søkbar arkivering av offentlege høyringar og møte
|
||||
|
|
|
|||
Loading…
Add table
Add a link
Reference in a new issue