Prompt-Caching hängt vom Provider und Modell ab. Nicht unterstützte Provider ignorieren Cache-Hinweise oder routen ohne Cache-Abrechnung. Die Modellseite zeigt in der Preistabelle die Preise für Cache-Lese- und Schreibvorgänge.
Was gecacht werden soll
Cach Inhalte, die über mehrere Anfragen hinweg stabil bleiben:- lange Systemanweisungen
- wiederverwendete RAG-Dokumente
- Few-Shot-Beispiele
- Tool-Definitionen
- umfangreiche Tool-Ergebnisse, die im nächsten Zug wiederverwendet werden
Cache-Steuerung
Phaseo akzeptiert bei Chat-Completions-, Responses- und Anthropic-Messages-Anfragen einen Kompatibilitätshinweiscache_control auf oberster Ebene:
ttl: "5m" für kurzlebigen gemeinsamen Kontext und ttl: "1h", wenn Provider und Modell länger gültige Prompt-Cache-Einträge unterstützen. Unterstützte Provider behandeln die Cache-Steuerung auf oberster Ebene als automatische Standardrichtlinie.
Du kannst cache_control auch direkt in unterstützten Text-, Bild-, Tool-Ergebnis- und Tool-Definitionsblöcken platzieren, um explizite Cache-Grenzen festzulegen:
provider_options eine standardmäßige Anthropic-Cache-Richtlinie festlegen:
scope:
cache_control auf Blockebene hat Vorrang vor der Standardrichtlinie.
Chat Completions
Nutze/v1/chat/completions mit OpenAI-kompatiblen Chat-Clients.
Responses
Nutze/v1/responses für neue OpenAI-kompatible Textintegrationen und Agentenabläufe.
provider_options.google.cached_content:
Anthropic Messages
Nutze/v1/messages, wenn dein Client Anthropic-kompatibel ist.
system-Textblöcke- Text- und Bildblöcke von Nachrichten
- Tool-Ergebnisblöcke
- Tool-Definitionen
Nutzungs- und Abrechnungsfelder
Wenn ein Provider Cache-Nutzungsdaten zurückgibt, vereinheitlicht Phaseo sie in gemeinsamen Nutzungsfeldern.
Cache-Schreibvorgänge sind meist teurer als normale Eingabetoken, Lesevorgänge meist günstiger. Die genauen Preise hängen vom Provider, Modell und TTL ab.
Praktische Prüfungen
Nach dem Einrichten von Prompt-Caching:- Sende eine Anfrage, um den Cache zu erstellen oder aufzuwärmen.
- Sende eine zweite Anfrage mit denselben cachefähigen Inhalten.
- Prüfe in den Nutzungsdaten der Antwort und den Anfragedetails die Cache-Lese- und Schreibfelder.
- Vergleiche Latenz und Kosten über mehrere Aufrufe hinweg, nicht nur beim ersten.
Provider-Affinität
Phaseo verwendet den Prompt-Cache-Verbrauch des Providers standardmäßig als Routing-Signal. Sobald ein Provider gecachte Eingabetoken zurückgibt, werden Anfragen mit demselben Cache-Schlüssel oder stabilem Anfangskontext 15 Minuten lang bevorzugt an diesen Provider geleitet. So muss kein anderer Provider für den erneuten Aufbau desselben Prompt-Caches bezahlt werden. Wenn dusession_id angibst, sorgt ein erkanntes Cache-Lesen zusätzlich für Session-Affinität.
Phaseo behält diese Affinität während des aktiven Sitzungsfensters bei und ermöglicht weiterhin
Failover, wenn der Provider gestört ist oder nicht mehr den Richtlinien entspricht.
Setze provider.cache_aware_routing auf false, um es für eine Anfrage zu deaktivieren. Setze
routing.session_affinity auf false, wenn die Anfrage eine session_id enthält
aber weiterhin nur normales kontextbasiertes Routing verwenden soll.
Verwandte Seiten
- Chat Completions
- Responses
- Anthropic Messages
- Parameter
- Kontext und Token-Budgetierung(./context-and-token-budgeting.mdx)
- Response-Caching mit Presets verwenden