feat(ms-ai-architect): Spor 1 — Port-1-substrat migrert på 4 ikke-advisor-skills (243 Source + 327 Type + 325 TOC + stale-verified poison fjernet) [skip-docs]
Steg 9 (R4): unified migrate-corpus.mjs --write over engineering/governance/ infrastructure/security. 327 filer mutert, verified=null, prosa byte-identisk (fra første ## seksjon), advisor urørt (0 endringer). To applier-fixes oppdaget under kjøring (TDD, RED→GREEN): - insertHeaderFields: anker faller nå tilbake når en meta-linje selv passerer 500B (2 filer pakket et avsnitt i **Status:** → Type/Source landet utenfor scan-vinduet, applierens post-write-assertion fanget + restaurerte). - normalizeStaleVerified: fjerner nå ALLE stale non-date **Verified:** i 500B-vinduet, inkl. stray body-dup rett under --- (9 mlops-genaiops-filer var ellers falskt "verified"/fresh, droppet fra worklist). Operatør-godkjent utvidelse av carve-out; kun stray metadata-linjer, aldri prosa. test-transform-criterion: precondition oppdatert til post-migrasjons-sannhet (fila bærer nå Source). Suite 728/728 grønn.
This commit is contained in:
parent
ed92d65385
commit
ddce43d8b2
330 changed files with 4643 additions and 83 deletions
|
|
@ -3,9 +3,22 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** Data Engineering for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/fabric/governance/external-data-sharing-overview
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Multi-Cloud Connector Strategies](#multi-cloud-connector-strategies)
|
||||
- [Data Egress Cost Optimization](#data-egress-cost-optimization)
|
||||
- [Consistency and Synchronization Patterns](#consistency-and-synchronization-patterns)
|
||||
- [Hybrid Cloud Fallback Mechanisms](#hybrid-cloud-fallback-mechanisms)
|
||||
- [Data Residency and Sovereignty Compliance](#data-residency-and-sovereignty-compliance)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Mange organisasjoner opererer i multi-cloud-miljoer der data er spredt mellom Azure, AWS, Google Cloud og on-premises systemer. For AI-losninger som krever data fra flere kilder er det kritisk a ha en effektiv strategi for krysssky-dataintegrasjon. Microsoft Fabric sin OneLake og shortcuts-arkitektur gjor det mulig a virtuelt samle data fra ulike skyplattformer uten fysisk kopiering, noe som reduserer bade egress-kostnader og kompleksitet.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,22 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** Data Engineering for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/machine-learning/concept-responsible-ai
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Differential Privacy Techniques](#differential-privacy-techniques)
|
||||
- [K-Anonymity and L-Diversity](#k-anonymity-and-l-diversity)
|
||||
- [PII Detection and Masking](#pii-detection-and-masking)
|
||||
- [Right-to-Be-Forgotten Implementation](#right-to-be-forgotten-implementation)
|
||||
- [Privacy Impact Assessments](#privacy-impact-assessments)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Personvern og databeskyttelse er fundamentale krav for enhver AI-losning som behandler personopplysninger. GDPR (og den norske Personopplysningsloven) stiller strenge krav til hvordan persondata samles inn, behandles og beskyttes. For AI-systemer er dette spesielt utfordrende: ML-modeller kan utilsiktet memorere persondata fra treningsdatasettet, og RAG-systemer kan eksponere sensitiv informasjon i svar.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,22 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** Data Engineering for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/purview/data-governance-overview
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Asset Registration and Metadata Enrichment](#asset-registration-and-metadata-enrichment)
|
||||
- [Search and Discovery Interfaces](#search-and-discovery-interfaces)
|
||||
- [Business Glossaries and Taxonomies](#business-glossaries-and-taxonomies)
|
||||
- [Data Owner and Steward Assignments](#data-owner-and-steward-assignments)
|
||||
- [Usage Analytics and Popularity Metrics](#usage-analytics-and-popularity-metrics)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Datakatalogisering og oppdagelse er fundamentale kapabiliteter for organisasjoner som bygger AI-løsninger. Uten en systematisk tilnærming til å registrere, beskrive og finne data, risikerer AI-team å bruke uforholdsmessig mye tid på å lete etter relevante datasett, duplisere eksisterende arbeid, eller trene modeller på data av ukjent kvalitet og opprinnelse. Microsoft Purview Unified Catalog er Microsofts svar på denne utfordringen -- en sentral plattform for å organisere, oppdage og forstå data på tvers av hele dataeiendommen.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA (Azure Data Factory), GA (Fabric Data Factory)
|
||||
**Category:** Data Engineering for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/fabric/data-factory/data-factory-overview
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter](#kjernekomponenter)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Azure Data Factory og Fabric Data Factory er Microsofts orkestreringsteknologier for data engineering-arbeidsflyter som understøtter AI-scenarioer. Teknologien lar deg automatisere dataprosessering, transformasjon, og orkestrering av machine learning-pipelines i storskalerte miljøer.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** Data Engineering for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/fabric/governance/onelake-catalog-overview
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Domain-Oriented Data Ownership](#domain-oriented-data-ownership)
|
||||
- [Data Product Versioning and Contracts](#data-product-versioning-and-contracts)
|
||||
- [Cross-Domain Data Sharing via Shortcuts](#cross-domain-data-sharing-via-shortcuts)
|
||||
- [Federated Governance and Shared Platform](#federated-governance-and-shared-platform)
|
||||
- [Scaling to 50+ Domains with OneLake](#scaling-to-50-domains-with-onelake)
|
||||
- [Anti-patterns og fallgruver](#anti-patterns-og-fallgruver)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Data mesh er en desentralisert dataarkitektur som organiserer data etter forretningsdomener i stedet for sentraliserte datateam. Prinsippene -- domeneeierskap, data som produkt, selvbetjeningsplattform og foderert styring -- er spesielt relevante for store organisasjoner som bygger AI-losninger pa tvers av avdelinger. Microsoft Fabric stotter data mesh-arkitektur gjennom domener, OneLake shortcuts og foderert governance.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** Data Engineering for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/fabric/data-factory/data-factory-overview
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Pipeline Scheduling and Triggers](#pipeline-scheduling-and-triggers)
|
||||
- [Dependency Chains and Critical Paths](#dependency-chains-and-critical-paths)
|
||||
- [Retry Policies and Error Handling](#retry-policies-and-error-handling)
|
||||
- [Monitoring and Alerting on Pipeline Health](#monitoring-and-alerting-on-pipeline-health)
|
||||
- [SLAs and Timeliness Guarantees](#slas-and-timeliness-guarantees)
|
||||
- [Apache Airflow i Fabric](#apache-airflow-i-fabric)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Datapipeline-orkestrering er ryggraden i enhver AI-plattform. Uten palitelig orkestrering kan data komme for sent, i feil rekkefølge, eller med manglende avhengigheter -- noe som forer til feil i ML-treningsjobber, utdaterte prediksjoner og upaalitelige AI-agenter. Microsoft tilbyr to hovedplattformer for orkestrering: Fabric Data Factory og Azure Data Factory, begge med pipeline-basert arbeidsflyt, triggers og overvaking.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA (Microsoft Purview Data Quality, Azure ML Model Monitoring, Fabric data quality)
|
||||
**Category:** Data Engineering for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/machine-learning/concept-model-monitoring
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter](#kjernekomponenter)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Data quality frameworks for AI sikrer at data som brukes til trening, validering og inferens av AI-modeller er nøyaktig, komplett, konsistent og pålitelig. I dagens AI-drevne landskap påvirker datakvalitet direkte AI-ytelsen, modellens nøyaktighet, og tillit til AI-beslutninger.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,22 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** Data Engineering for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/machine-learning/how-to-label-data
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Stratified Sampling for Class Balance](#stratified-sampling-for-class-balance)
|
||||
- [Active Learning and Uncertainty Sampling](#active-learning-and-uncertainty-sampling)
|
||||
- [Crowdsourcing and Labeling Platforms](#crowdsourcing-and-labeling-platforms)
|
||||
- [Quality Control and Inter-Rater Agreement](#quality-control-and-inter-rater-agreement)
|
||||
- [Feedback Loops for Continuous Labeling](#feedback-loops-for-continuous-labeling)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Kvaliteten pa treningsdata er den viktigste faktoren for ytelsen til ML-modeller. Effektiv datasampling sikrer at treningsdatasettet er representativt og balansert, mens systematisk datamerking (labeling) gir modellene de korrekte signalene a laere fra. Azure Machine Learning tilbyr en komplett plattform for datamerking med stotte for bade bilde- og tekstdata, inkludert ML-assistert merking som akselererer prosessen vesentlig.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,22 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** Data Engineering for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/fabric/governance/lineage
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Delta Lake Versioning and Time-Travel](#delta-lake-versioning-and-time-travel)
|
||||
- [Commit History and Audit Trails](#commit-history-and-audit-trails)
|
||||
- [Data Lineage Visualization in Purview](#data-lineage-visualization-in-purview)
|
||||
- [Upstream/Downstream Dependency Mapping](#upstreamdownstream-dependency-mapping)
|
||||
- [Rollback and Recovery Strategies](#rollback-and-recovery-strategies)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Dataversionskontroll og lineage-sporing er grunnleggende kapabiliteter for pålitelige AI-systemer. Versjonskontroll gjør det mulig å reprodusere eksakt de dataene en modell ble trent på, mens lineage dokumenterer hele datareisen fra kilde til ferdig prediksjon. Sammen gir de sporbarhet, reproduserbarhet og tillitsgrunnlag for AI-beslutninger.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,22 @@
|
|||
**Last updated:** 2026-02
|
||||
**Status:** GA
|
||||
**Category:** Data Engineering for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/fabric/data-factory/connector-dataverse-overview
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Dataverse Connectors in Data Factory](#dataverse-connectors-in-data-factory)
|
||||
- [Entity Relationship Mapping to Delta Tables](#entity-relationship-mapping-to-delta-tables)
|
||||
- [Real-Time Dataverse Data Sync](#real-time-dataverse-data-sync)
|
||||
- [Power Platform Data Integration](#power-platform-data-integration)
|
||||
- [RLS Propagation from Dataverse to Fabric](#rls-propagation-from-dataverse-to-fabric)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Microsoft Dataverse er den sentrale dataplattformen for Power Platform og Dynamics 365, og inneholder forretningskritisk data fra CRM, ERP, og egendefinerte applikasjoner. Integrering av Dataverse-data med AI-losninger via Microsoft Fabric og Data Factory gjor det mulig a utnytte forretningsdata for prediktiv analyse, maskinlaring og intelligent automatisering uten komplekse ETL-pipelines.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** Data Engineering for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/fabric/data-engineering/delta-optimization-and-v-order
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Delta Lake ACID Transactions and Z-Order](#delta-lake-acid-transactions-and-z-order)
|
||||
- [Parquet Compression Codecs and Row Groups](#parquet-compression-codecs-and-row-groups)
|
||||
- [File Size Tuning and Auto-Compaction](#file-size-tuning-and-auto-compaction)
|
||||
- [V-Order Optimization](#v-order-optimization)
|
||||
- [Small File Handling and Garbage Collection](#small-file-handling-and-garbage-collection)
|
||||
- [Best Practices for AI-arbeidsbelastninger](#best-practices-for-ai-arbeidsbelastninger)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Delta Lake er det foretrukne tabellformatet i Microsoft Fabric, bygget oppå Apache Parquet med ACID-transaksjoner, skjemavalidering og tidsreise. For AI-arbeidsbelastninger er ytelsen til underliggende lagring kritisk: dårlig filstruktur kan gjore treningsjobber 10x tregere og forre til unodvendig hoy kostnad. Optimalisering av Delta Lake og Parquet-filer er derfor en kjerneferdighet for enhver dataingenioor som bygger AI-pipelines.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,22 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** Data Engineering for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/fabric/data-factory/data-factory-overview
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [ELT Advantages: Cost, Scalability, Schema-Flexibility](#elt-advantages-cost-scalability-schema-flexibility)
|
||||
- [ETL Data Minimization for Regulated Environments](#etl-data-minimization-for-regulated-environments)
|
||||
- [Hybrid ETL/ELT Patterns](#hybrid-etlelt-patterns)
|
||||
- [Data Staging and Incremental Processing](#data-staging-and-incremental-processing)
|
||||
- [Compute Cost Allocation: ETL vs ELT](#compute-cost-allocation-etl-vs-elt)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Valget mellom ETL (Extract, Transform, Load) og ELT (Extract, Load, Transform) er en av de mest grunnleggende arkitekturbeslutningene for dataintegrasjon i AI-prosjekter. Tradisjonell ETL transformerer data før lasting i et dedikert transformasjonsengine, mens moderne ELT laster rådata først og utnytter målsystemets beregningskraft for transformasjon. Microsoft Fabric støtter begge tilnærminger og hybride mønstre.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** Data Engineering for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/fabric/data-engineering/lakehouse-overview
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter](#kjernekomponenter)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Microsoft Fabric Lakehouse er Microsofts moderne dataplattformløsning som kombinerer det beste fra data lakes og data warehouses i én enkelt, unified arkitektur. Lakehouse bruker åpne standarder (Delta Lake) og gir en SaaS-opplevelse hvor strukturert, semistrukturert og ustrukturert data kan lagres sammen i OneLake, som er Microsofts single, unified, logical data lake for hele organisasjonen.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,22 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** Data Engineering for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/machine-learning/concept-what-is-managed-feature-store
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Feature Definition and Storage in Silver Layer](#feature-definition-and-storage-in-silver-layer)
|
||||
- [Point-in-Time Lookups for Training](#point-in-time-lookups-for-training)
|
||||
- [Feature Freshness and Refresh Cadences](#feature-freshness-and-refresh-cadences)
|
||||
- [Data Wrangler for Exploratory Feature Engineering](#data-wrangler-for-exploratory-feature-engineering)
|
||||
- [Feature Monitoring and Drift Detection](#feature-monitoring-and-drift-detection)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Feature stores er et sentralt mønster i moderne MLOps som løser problemet med feature-gjenbruk, konsistens mellom trening og inferens, og operasjonalisering av feature-pipelines. Azure Machine Learning Managed Feature Store og Microsoft Fabric Data Science gir en komplett plattform for å definere, materialisere, dele og overvåke features på tvers av ML-prosjekter.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** Data Engineering for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/fabric/data-engineering/lakehouse-overview
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Delta Lake Transaction Semantics](#delta-lake-transaction-semantics)
|
||||
- [Schema-on-Read versus Schema-on-Write Tradeoffs](#schema-on-read-versus-schema-on-write-tradeoffs)
|
||||
- [Time-Travel and Data Versioning](#time-travel-and-data-versioning)
|
||||
- [Upsert and Merge Patterns for Slowly-Changing Dimensions](#upsert-and-merge-patterns-for-slowly-changing-dimensions)
|
||||
- [Lakehouse Performance Tuning](#lakehouse-performance-tuning)
|
||||
- [Medallion Architecture Deployment](#medallion-architecture-deployment)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Lakehouse-arkitekturen kombinerer de beste egenskapene fra data lakes (fleksibel lagring av strukturerte, semi-strukturerte og ustrukturerte data) med data warehouse-funksjonalitet (ACID-transaksjoner, skjemahåndtering og høy spørringsytelse). Microsoft Fabric standardiserer på Delta Lake-formatet, som gir denne hybridkapabiliteten nativt på tvers av alle Fabric-opplevelser.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,22 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** Data Engineering for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/purview/data-governance-master-data-management
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Golden Record Creation and Reconciliation](#golden-record-creation-and-reconciliation)
|
||||
- [Entity Resolution and Deduplication](#entity-resolution-and-deduplication)
|
||||
- [MDM Integration with Dataverse](#mdm-integration-with-dataverse)
|
||||
- [Reference Data Versioning](#reference-data-versioning)
|
||||
- [Data Quality SLAs for MDM Entities](#data-quality-slas-for-mdm-entities)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Master Data Management (MDM) skaper en enkelt kilde til sannhet for kritiske forretningsenheter som kunder, produkter, ansatte og lokasjoner. For AI-losninger er kvaliteten pa stamdata direkte avgjorede -- en ML-modell trent pa inkonsistente kundedata vil produsere upaalitelige prediksjoner, og en RAG-losning med dupliserte dokumenter vil gi motstridende svar.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-19
|
||||
**Status:** GA
|
||||
**Category:** Data Engineering for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/purview/unified-catalog
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Purview Catalog and Asset Registration](#purview-catalog-and-asset-registration)
|
||||
- [Data Classification and Sensitivity Labels](#data-classification-and-sensitivity-labels)
|
||||
- [Lineage Tracking Across Fabric](#lineage-tracking-across-fabric)
|
||||
- [Policy Enforcement and Access Management](#policy-enforcement-and-access-management)
|
||||
- [GDPR/HIPAA Compliance Auditing](#gdprhipaa-compliance-auditing)
|
||||
- [Purview Governance for Fabric Copilots og Agenter *(Verified MCP 2026-04)*](#purview-governance-for-fabric-copilots-og-agenter-verified-mcp-2026-04)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Microsoft Purview er Microsofts samlete plattform for datastyring, risikohåndtering og compliance. For AI-løsninger er Purview avgjørende fordi det gir oversikt over hvor sensitiv data befinner seg, hvordan data flyter gjennom organisasjonen (lineage), og hvorvidt datakvaliteten er tilstrekkelig for å trene pålitelige modeller. Uten god datastyring kan AI-modeller forsterke bias, bryte personvernregler eller produsere upålitelige prediksjoner.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA (Shortcuts, OneLake Security for kjerne-engines, Shortcut Transformations for CSV/Parquet/JSON), Preview (OneLake Security på Eventhouse/3.-parts-engines, Shortcut Transformations for Excel + AI-powered)
|
||||
**Category:** Data Engineering for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/fabric/real-time-intelligence/query-acceleration-overview
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter](#kjernekomponenter)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Kilder og verifisering](#kilder-og-verifisering)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
OneLake er Microsofts unified data lake for hele Microsoft Fabric-plattformen — "OneDrive for data". Hver Fabric-tenant får automatisk provisjonert én enkelt, logisk data lake som binder sammen alle analytiske workloads. Shortcuts er en av OneLakes mest kraftfulle mekanismer: de fungerer som symbolske lenker (symbolic links) som lar deg unifisere data på tvers av domener, skyer og kontoer uten å flytte eller duplisere data.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,23 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** Data Engineering for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/fabric/real-time-intelligence/overview
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Eventstream Connectors and Topologies](#eventstream-connectors-and-topologies)
|
||||
- [Structured Streaming with Spark](#structured-streaming-with-spark)
|
||||
- [KQL Database for Time-Series Analytics](#kql-database-for-time-series-analytics)
|
||||
- [Event Filtering and Derived Streams](#event-filtering-and-derived-streams)
|
||||
- [Streaming SLAs and Backpressure Handling](#streaming-slas-and-backpressure-handling)
|
||||
- [Arkitekturmonstre for AI med sanntidsdata](#arkitekturmonstre-for-ai-med-sanntidsdata)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Sanntidsdatastrømming er en fundamental byggestein for AI-applikasjoner som krever umiddelbar respons på hendelser -- fra IoT-sensorer og transaksjoner til brukeratferd og systemmetrikker. Microsoft Fabric Real-Time Intelligence kombinert med Azure Event Hubs og Apache Kafka gir en komplett plattform for inntak, transformasjon og analyse av strømmedata som mater AI-modeller med oppdatert informasjon.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,22 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA
|
||||
**Category:** Data Engineering for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/synapse-analytics/spark/apache-spark-what-is-delta-lake
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Schema Versioning and Compatibility Levels](#schema-versioning-and-compatibility-levels)
|
||||
- [Adding Columns with Default Values](#adding-columns-with-default-values)
|
||||
- [Type Promotions and Narrowing](#type-promotions-and-narrowing)
|
||||
- [Deprecated Column Handling](#deprecated-column-handling)
|
||||
- [Schema Registration and Validation](#schema-registration-and-validation)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Skjemaendringer er uunngaaelige i moderne dataarkitekturer: nye kolonner legges til, datatyper endres, kolonner gis nye navn, og foreldede felt fjernes. For AI-pipelines er dette spesielt utfordrende fordi ML-modeller er trent pa spesifikke feature-skjemaer, og enhver skjemaendring kan bryte trenings- og inferens-pipelines. Delta Lake i Microsoft Fabric og Azure Databricks tilbyr robust stotte for skjemaevolusjon som gjor det mulig a haandtere disse endringene uten nedetid.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,22 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA / Preview (varies by feature)
|
||||
**Category:** Data Engineering for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/azure/foundry-classic/openai/concepts/use-your-data
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Synthetic Data Generation Pipelines](#synthetic-data-generation-pipelines)
|
||||
- [Azure OpenAI Integration for Text Synthesis](#azure-openai-integration-for-text-synthesis)
|
||||
- [Balancing Class Imbalances with Synthetic Samples](#balancing-class-imbalances-with-synthetic-samples)
|
||||
- [Privacy-Preserving Synthetic Data](#privacy-preserving-synthetic-data)
|
||||
- [Validation of Synthetic Data Quality](#validation-of-synthetic-data-quality)
|
||||
- [Referanser](#referanser)
|
||||
- [For Cosmo](#for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Syntetisk datagenerering er en stadig viktigere teknikk for AI-utvikling, spesielt i situasjoner der reelle data er begrenset, ubalansert, eller underlagt strenge personvernkrav. Ved å generere kunstige datasett som etterligner statistiske egenskaper ved reelle data, kan organisasjoner utvide treningsdata, adressere klasseimbalanser, og beskytte personvern -- uten å eksponere faktiske sensitive opplysninger.
|
||||
|
|
|
|||
|
|
@ -3,9 +3,28 @@
|
|||
**Last updated:** 2026-06-24
|
||||
**Status:** GA (Database Mirroring), Preview (Open Mirroring for some sources)
|
||||
**Category:** Data Engineering for AI
|
||||
**Type:** reference
|
||||
**Source:** https://learn.microsoft.com/fabric/mirroring/overview
|
||||
|
||||
---
|
||||
|
||||
## Innhold
|
||||
|
||||
- [Introduksjon](#introduksjon)
|
||||
- [Kjernekomponenter](#kjernekomponenter)
|
||||
- [Arkitekturmønstre](#arkitekturmønstre)
|
||||
- [Beslutningsveiledning](#beslutningsveiledning)
|
||||
- [Integrasjon med Microsoft-stakken](#integrasjon-med-microsoft-stakken)
|
||||
- [Offentlig sektor (Norge)](#offentlig-sektor-norge)
|
||||
- [Kostnad og Lisensiering](#kostnad-og-lisensiering)
|
||||
- [For arkitekten (Cosmo)](#for-arkitekten-cosmo)
|
||||
- [Tekniske Detaljer](#tekniske-detaljer)
|
||||
- [Praktisk Eksempel: End-to-End Setup](#praktisk-eksempel-end-to-end-setup)
|
||||
- [Vanlige Feil og Løsninger](#vanlige-feil-og-løsninger)
|
||||
- [Fremtidige Utvidelser (Roadmap)](#fremtidige-utvidelser-roadmap)
|
||||
- [Kilder og Verifisering](#kilder-og-verifisering)
|
||||
- [Oppsummering for Cosmo](#oppsummering-for-cosmo)
|
||||
|
||||
## Introduksjon
|
||||
|
||||
Zero-ETL i Microsoft Fabric representerer et paradigmeskifte i hvordan organisasjoner integrerer og konsoliderer data. I stedet for komplekse Extract-Transform-Load (ETL) pipelines, tilbyr Fabric **Mirroring** — en nær-sanntids, kontinuerlig replikeringsløsning som speilser operasjonelle data direkte inn i OneLake som Delta Lake-tabeller.
|
||||
|
|
|
|||
Loading…
Add table
Add a link
Reference in a new issue