docs(ms-ai-architect): KB-refresh tema-b — Foundry-navnesveip «Azure AI Foundry»→«Microsoft Foundry» (233 filer)
Verifisert mot offisiell MS-doc (juni 2026): «Microsoft Foundry» er det gjeldende produkt-/portalnavnet; «Foundry (classic)» = gamle «Azure AI Foundry» (/azure/foundry/ vs /azure/foundry-classic/). Premiss bekreftet før sveip. Multi-regel, IKKE naiv s/Azure AI Foundry/Microsoft Foundry/ — MS dropper «Azure AI» (legger IKKE til «Microsoft») for to produktvarianter: - «Azure AI Foundry Agent[ Service|s]» → «Foundry Agent Service/Agents» (MS-form) - «Azure AI Foundry Models» → «Foundry Models» (i «Azure OpenAI in Foundry Models») - «Azure AI Foundry SDK» → «Microsoft Foundry SDK» (operatør-valg) - «Azure AI Foundry portal/project» + generisk → «Microsoft Foundry» - Pre-eksisterende «Microsoft Foundry Models» (4) normalisert → «Foundry Models» Bevart: «Azure OpenAI», «Azure AI Inference SDK», «Azure AI Search», «Azure AI Services», kode-IDer. Historisk ref «(tidligere Azure AI Foundry)» i model-catalog-2026.md beskyttet via lookbehind. URL /azure/ai-foundry/→ /azure/foundry/ kun i owasp-llm-top10 (KB-ref); docs/-filer deferred. Scope: skills (inkl. 3 SKILL.md) + commands + agents + README + CLAUDE. Ekskludert: docs/ (interne), playground/+tests/ fixtures (testdata), CHANGELOG.md (historisk logg), STATE.md (gitignored). 3 SKILL.md endret (advisor/engineering/security) → judge-cache teknisk invalidert for disse, men scorer uendret: advisor 91, eng/gov/infra/sec 96 (alle ≥90). validate 239/0. 0 «Azure AI Foundry» igjen (utenom bevart ref). Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
This commit is contained in:
parent
20b522ab10
commit
03d596e4ec
233 changed files with 810 additions and 810 deletions
|
|
@ -11,7 +11,7 @@
|
|||
|
||||
## Introduksjon
|
||||
|
||||
Evaluering av AI-modeller, spesielt generative AI-applikasjoner, krever en helt annen tilnærming enn tradisjonell maskinlæring. Mens tradisjonell ML fokuserer på deterministiske metrikker som accuracy og precision, må GenAI-evaluering håndtere multi-turn-samtaler, kontekstuell relevans, sikkerhet og subjektiv kvalitet. Microsoft tilbyr et omfattende rammeverk for modellevaluering gjennom Azure AI Foundry, Azure Machine Learning Prompt Flow og MLflow 3, som dekker hele utviklingsløpet fra modellvalg til produksjonsovervåking.
|
||||
Evaluering av AI-modeller, spesielt generative AI-applikasjoner, krever en helt annen tilnærming enn tradisjonell maskinlæring. Mens tradisjonell ML fokuserer på deterministiske metrikker som accuracy og precision, må GenAI-evaluering håndtere multi-turn-samtaler, kontekstuell relevans, sikkerhet og subjektiv kvalitet. Microsoft tilbyr et omfattende rammeverk for modellevaluering gjennom Microsoft Foundry, Azure Machine Learning Prompt Flow og MLflow 3, som dekker hele utviklingsløpet fra modellvalg til produksjonsovervåking.
|
||||
|
||||
Evalueringsrammeverket støtter tre hovedfaser: **base model selection** (sammenligning av foundation models), **pre-production evaluation** (testing mot ground truth-datasett), og **production monitoring** (kontinuerlig kvalitetsvurdering med live data). Hver fase bruker en kombinasjon av matematiske metrikker (NLP-baserte), AI-assisterte metrikker (LLM-as-a-judge), og sikkerhetsvurderinger. Dette gir en helhetlig vurdering av modellens kapabiliteter, begrensninger og ansvarlighetsprofil.
|
||||
|
||||
|
|
@ -29,7 +29,7 @@ Evalueringsprosessen er iterativ og datadrevet. Den starter med å etablere en b
|
|||
|
||||
### Evaluation Targets
|
||||
|
||||
Azure AI Foundry støtter tre evalueringsmål:
|
||||
Microsoft Foundry støtter tre evalueringsmål:
|
||||
|
||||
1. **Model** — Evaluer en modell-deployment med bruker-definert prompt mot et datasett (genererer svar on-the-fly).
|
||||
2. **Agent** — Evaluer en agent (Copilot Studio, Microsoft Agent Framework) med strukturert reasoning og tool calls.
|
||||
|
|
@ -287,7 +287,7 @@ Microsoft validerer judge quality gjennom:
|
|||
|
||||
## Integrasjon med Microsoft-stakken
|
||||
|
||||
### Azure AI Foundry Portal
|
||||
### Microsoft Foundry Portal
|
||||
|
||||
- **Evaluation page** → UI for å opprette, kjøre og visualisere evalueringer.
|
||||
- **Model Catalog → Benchmarks** → Sammenlign modeller mot public benchmarks eller egne data.
|
||||
|
|
@ -369,7 +369,7 @@ continuous_eval_rule = project_client.evaluation_rules.create_or_update(
|
|||
|
||||
### GDPR og datasuverenitet
|
||||
|
||||
- **Test data med personopplysninger** → Må anonymiseres eller syntetiseres. Azure AI Foundry's synthetic data generation kan brukes.
|
||||
- **Test data med personopplysninger** → Må anonymiseres eller syntetiseres. Microsoft Foundry's synthetic data generation kan brukes.
|
||||
- **Evaluering i EU-regioner** → AI-assisted safety metrics hosted kun i East US 2, France Central, UK South, Sweden Central. **Velg France Central eller Sweden Central for norske virksomheter.**
|
||||
- **Ground truth datasets** → Hvis de inneholder sensitive data, må de lagres i GDPR-compliant storage (Azure Blob Storage med encryption at rest, managed identity, private endpoint).
|
||||
|
||||
|
|
@ -389,7 +389,7 @@ continuous_eval_rule = project_client.evaluation_rules.create_or_update(
|
|||
| Klassifisering | Evaluation data handling |
|
||||
|----------------|--------------------------|
|
||||
| **Åpent** | Kan bruke Azure OpenAI (Europe), Databricks-hosted judges. |
|
||||
| **Begrenset** | Anonymiser før evaluering, bruk Azure AI Foundry med private endpoint. |
|
||||
| **Begrenset** | Anonymiser før evaluering, bruk Microsoft Foundry med private endpoint. |
|
||||
| **Fortrolig** | Kun self-hosted judges (deploy GPT-4o i eget subscription), ingen Databricks-hosted models. |
|
||||
| **Strengt fortrolig** | Evaluering på-premises eller Azure confidential computing (ikke GA for LLM judges). |
|
||||
|
||||
|
|
@ -414,7 +414,7 @@ continuous_eval_rule = project_client.evaluation_rules.create_or_update(
|
|||
|
||||
### Lisensiering
|
||||
|
||||
- **Azure AI Foundry** → Pay-as-you-go (ingen lisenskostnad for platform, betaler kun for compute/LLM tokens).
|
||||
- **Microsoft Foundry** → Pay-as-you-go (ingen lisenskostnad for platform, betaler kun for compute/LLM tokens).
|
||||
- **Azure Machine Learning** → Samme som over.
|
||||
- **MLflow 3 (Databricks)** → Inkludert i Databricks-abonnement (Premium/Enterprise tier).
|
||||
- **Azure AI Evaluation SDK** → Open source (MIT license), gratis å bruke.
|
||||
|
|
@ -452,7 +452,7 @@ Hvis du kjører massive evalueringer (100K+ samples), vurder PTU for judge model
|
|||
### Anbefalinger per modenhetsnivå
|
||||
|
||||
**Nivå 1: PoC/MVP (1-2 måneder)**
|
||||
- Bruk Azure AI Foundry UI (no-code).
|
||||
- Bruk Microsoft Foundry UI (no-code).
|
||||
- Kjør 3-4 metrikker (Relevance, Coherence, Groundedness, Safety).
|
||||
- Dataset: 20-50 manually curated samples.
|
||||
- Threshold: Soft targets (ikke blokkering).
|
||||
|
|
|
|||
Loading…
Add table
Add a link
Reference in a new issue