Skip to main content
Nutze Prompt-Caching, wenn derselbe umfangreiche Kontext in vielen Anfragen vorkommt. Markiere stabile Anweisungen, Dokumente, Beispiele, Tool-Ergebnisse oder Tool-Definitionen als cachefähig, damit unterstützte Provider sie bei späteren Aufrufen wiederverwenden können. Prompt-Caching unterscheidet sich vom Response-Caching. Die Inferenz wird weiterhin ausgeführt, aber Prompt-Caching kann Kosten und Latenz bei wiederholter Eingabeverarbeitung reduzieren. Response-Caching gibt eine zuvor generierte Antwort für eine identische Anfrage zurück.
Prompt-Caching hängt vom Provider und Modell ab. Nicht unterstützte Provider ignorieren Cache-Hinweise oder routen ohne Cache-Abrechnung. Die Modellseite zeigt in der Preistabelle die Preise für Cache-Lese- und Schreibvorgänge.

Was gecacht werden soll

Cach Inhalte, die über mehrere Anfragen hinweg stabil bleiben:
  • lange Systemanweisungen
  • wiederverwendete RAG-Dokumente
  • Few-Shot-Beispiele
  • Tool-Definitionen
  • umfangreiche Tool-Ergebnisse, die im nächsten Zug wiederverwendet werden
Cach keine Inhalte, die sich mit jeder Anfrage ändern, kurze einmalige Nutzereingaben enthalten oder sensible Daten umfassen, die laut Richtlinie nicht beim ausgewählten Provider gespeichert werden dürfen.

Cache-Steuerung

Phaseo akzeptiert bei Chat-Completions-, Responses- und Anthropic-Messages-Anfragen einen Kompatibilitätshinweis cache_control auf oberster Ebene:
Verwende ttl: "5m" für kurzlebigen gemeinsamen Kontext und ttl: "1h", wenn Provider und Modell länger gültige Prompt-Cache-Einträge unterstützen. Unterstützte Provider behandeln die Cache-Steuerung auf oberster Ebene als automatische Standardrichtlinie. Du kannst cache_control auch direkt in unterstützten Text-, Bild-, Tool-Ergebnis- und Tool-Definitionsblöcken platzieren, um explizite Cache-Grenzen festzulegen:
Providerspezifische Aliase werden weiterhin unterstützt. Beispielsweise kannst du über provider_options eine standardmäßige Anthropic-Cache-Richtlinie festlegen:
Unterstützte Werte für scope: cache_control auf Blockebene hat Vorrang vor der Standardrichtlinie.

Chat Completions

Nutze /v1/chat/completions mit OpenAI-kompatiblen Chat-Clients.
Übermittle bei OpenAI-gerouteten Anfragen die Cache-Aufbewahrungsoptionen von OpenAI über das kompatible Feld auf oberster Ebene:
Der providerspezifische Alias wird ebenfalls akzeptiert:

Responses

Nutze /v1/responses für neue OpenAI-kompatible Textintegrationen und Agentenabläufe.
Wenn du bereits eine gecachte Inhaltsressource von Google Gemini hast, übermittle sie über provider_options.google.cached_content:

Anthropic Messages

Nutze /v1/messages, wenn dein Client Anthropic-kompatibel ist.
Anthropic Messages unterstützt Cache-Steuerung für:
  • system-Textblöcke
  • Text- und Bildblöcke von Nachrichten
  • Tool-Ergebnisblöcke
  • Tool-Definitionen

Nutzungs- und Abrechnungsfelder

Wenn ein Provider Cache-Nutzungsdaten zurückgibt, vereinheitlicht Phaseo sie in gemeinsamen Nutzungsfeldern. Cache-Schreibvorgänge sind meist teurer als normale Eingabetoken, Lesevorgänge meist günstiger. Die genauen Preise hängen vom Provider, Modell und TTL ab.

Praktische Prüfungen

Nach dem Einrichten von Prompt-Caching:
  1. Sende eine Anfrage, um den Cache zu erstellen oder aufzuwärmen.
  2. Sende eine zweite Anfrage mit denselben cachefähigen Inhalten.
  3. Prüfe in den Nutzungsdaten der Antwort und den Anfragedetails die Cache-Lese- und Schreibfelder.
  4. Vergleiche Latenz und Kosten über mehrere Aufrufe hinweg, nicht nur beim ersten.

Provider-Affinität

Phaseo verwendet den Prompt-Cache-Verbrauch des Providers standardmäßig als Routing-Signal. Sobald ein Provider gecachte Eingabetoken zurückgibt, werden Anfragen mit demselben Cache-Schlüssel oder stabilem Anfangskontext 15 Minuten lang bevorzugt an diesen Provider geleitet. So muss kein anderer Provider für den erneuten Aufbau desselben Prompt-Caches bezahlt werden. Wenn du session_id angibst, sorgt ein erkanntes Cache-Lesen zusätzlich für Session-Affinität. Phaseo behält diese Affinität während des aktiven Sitzungsfensters bei und ermöglicht weiterhin Failover, wenn der Provider gestört ist oder nicht mehr den Richtlinien entspricht. Setze provider.cache_aware_routing auf false, um es für eine Anfrage zu deaktivieren. Setze routing.session_affinity auf false, wenn die Anfrage eine session_id enthält aber weiterhin nur normales kontextbasiertes Routing verwenden soll.

Verwandte Seiten

Zuletzt geändert am 2. Oktober 2026