diff --git a/skills/ms-ai-advisor/references/prompt-engineering/multi-turn-conversation-management.md b/skills/ms-ai-advisor/references/prompt-engineering/multi-turn-conversation-management.md index 5529e12..e87045a 100644 --- a/skills/ms-ai-advisor/references/prompt-engineering/multi-turn-conversation-management.md +++ b/skills/ms-ai-advisor/references/prompt-engineering/multi-turn-conversation-management.md @@ -1,6 +1,6 @@ # Multi-Turn Conversation and Context Management -**Last updated:** 2026-02 +**Last updated:** 2026-06-24 **Status:** GA **Category:** Prompt Engineering & LLM Optimization @@ -312,7 +312,7 @@ AgentSession resumedSession = await agent.DeserializeSessionAsync(serializedSess - Prompt tokens + `max_tokens` parameter + `best_of` parameter - **Ikke** identisk med billing token count -**RPM (Requests-Per-Minute)** er koblet til TPM: **6 RPM per 1K TPM**. +**RPM (Requests-Per-Minute)** er koblet til TPM, men **forholdet varierer per modell**. For eldre chat-modeller (gpt-4o-klassen) er det **6 RPM per 1K TPM**; reasoning-modeller bruker andre forhold (f.eks. o3 og o4-mini: 1 RPM/1K TPM; o3-mini, o1-mini og o3-pro: 1 RPM/10K TPM; o1: 1 RPM/6K TPM). **Best practices:** - Implementer exponential backoff ved 429-errors