For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Hauptnavigation

Prompt-Caching

Reduziere Latenz und Kosten mit Prompt-Caching.

Warum Prompt-Caching wichtig ist

Prompt-Caching verwendet bereits durchgeführte Berechnungen erneut, wenn Anfragen dasselbe Prompt-Präfix haben. Das bietet drei wesentliche Vorteile:

  • Weniger Rechenaufwand: Vermeide erneute Berechnungen für ein Prompt-Präfix, das das Modell bereits verarbeitet hat.
  • Günstigere Eingabetokens: Für wiederverwendete Tokens zahlst du den reduzierten Tarif des Modells für zwischengespeicherte Eingaben, mit bis zu 90 % Rabatt.
  • Schneller: Verkürze die Verarbeitung der Eingabe, bevor die Antwort beginnt.

Prompt-Caching ist bei unterstützten OpenAI-Modellen standardmäßig aktiviert. Überwache im Prompt-Caching-Dashboard die Trefferquoten beim Lesen aus dem Cache. Nutze das Werkzeug zur Diagnose des Prompt-Caches, um fehlende Cache-Treffer zu untersuchen und die Wiederverwendung des Caches zu verbessern.

Modellaufrufe über die Agents API verwenden dasselbe Prompt-Caching-Verhalten wie die Responses API. Wenn du Kontext innerhalb einer Sitzung wiederverwendest, kann ein gemeinsames Prompt-Präfix erhalten bleiben. Eine Sitzung beizubehalten garantiert jedoch keinen Cache-Treffer. Informationen zu den Feldern für die Sitzungsnutzung und zur Erfassung der Subagenten-Nutzung findest du unter Beobachtbarkeit und Nutzung.

Die Preise für Prompt-Caching variieren je nach Modell. Die aktuellen Tarife für zwischengespeicherte Eingaben und Cache-Schreibvorgänge findest du unter API-Preise. Für Cache-Schreibvorgänge fällt keine zusätzliche Gebühr an: Für Eingabetoken gilt jeweils der Tarif für nicht zwischengespeicherte Eingaben, zwischengespeicherte Eingaben oder Cache-Schreibvorgänge.

Was ist der Prompt-Cache?

Wenn das Modell Eingabetokens verarbeitet, muss es Zwischenzustände berechnen, die als Key-Value-Zustände (KV-Zustände) bezeichnet werden. Mithilfe dieser Zustände kann das Modell auf frühere Tokens zurückgreifen, während es neue Eingaben verarbeitet und Ausgabetokens generiert.

Prompt-Caching speichert diesen Zustand für ein wiederverwendbares Präfix: die unveränderten Tokens am Anfang eines Prompts. Wenn eine spätere Anfrage dasselbe Präfix hat und einen passenden Cache-Eintrag findet, kann das Modell den gespeicherten Zustand wiederverwenden, statt diese Tokens erneut zu verarbeiten. Neue Eingaben muss es weiterhin verarbeiten, um eine neue Antwort zu generieren.

Der Prompt-Cache speichert Key-Value-Tensoren (KV-Tensoren), nicht die Tokens selbst.

Bitte ChatGPT um eine ausführlichere Erklärung

OpenAI speichert den vollständigen gerenderten Kontext des Modells im Cache. Dazu gehören von OpenAI bereitgestellte Anweisungen, Developer-Nachrichten, Werkzeugdefinitionen und der Gesprächsverlauf mit Text, Bildern, Dokumenten und unterstützten Audioinhalten.

Für die Wiederverwendung des Caches muss das gesamte gerenderte Präfix übereinstimmen. Ändern sich Inhalte oder eine relevante Einstellung vor einem Breakpoint, kann das Präfix ab dieser Änderung nicht mehr mit dem vorhandenen Cache-Eintrag übereinstimmen.

So funktioniert Caching

Ein Cache-Breakpoint markiert das Ende eines Prompt-Präfixes, das OpenAI im Cache speichern und in späteren Anfragen wiederverwenden kann. Die erste Anfrage schreibt ein geeignetes Präfix in den Cache. Nachfolgende Anfragen suchen nach dem längsten verfügbaren, übereinstimmenden Präfix im Cache. Dazu gehen sie die geeigneten Breakpoints rückwärts durch, bis sie einen Treffer finden.

Ein Prompt-Präfix muss die vom Modell vorgegebene Mindestlänge in Tokens für das Caching erreichen, bevor es im Cache gespeichert werden kann. Tokens in den von OpenAI bereitgestellten verborgenen Systeminhalten zählen nicht zu dieser Mindestlänge. Bei GPT-5.6 und neueren Modellen beträgt die Mindestlänge eines zwischenspeicherbaren Prompts 1.024 Tokens. Bei früheren Modellen hängt sie von den Anfrageeinstellungen ab. Einzelheiten findest du im Modellvergleich.

Sobald die Mindestlänge in Tokens für das Caching erreicht ist, kannst du Cache-Breakpoints explizit selbst setzen oder ihre Positionen implizit von OpenAI wählen lassen. Welche Optionen verfügbar sind, hängt vom Modell ab.

So funktioniert der Präfixabgleich

OpenAI prüft in der eingehenden Anfrage ausschließlich die unten erläuterten Grenzen für die Cache-Suche , vom längsten bis zum kürzesten Präfix. Dabei sucht OpenAI nach einem passenden Präfix, das bereits im Cache des Rechners verfügbar ist.

Für GPT-5.6 und spätere Modelle gelten in der eingehenden Anfrage folgende Grenzen für die Cache-Suche:

  • Rein expliziter Modus: Die ersten 2 und die letzten 50 expliziten Breakpoints.
  • Impliziter Modus: Die ersten 2 und die letzten 50 expliziten Breakpoints, der implizite Breakpoint, bis zu 20 frühere geeignete Nachrichtenenden sowie das Ende des anfänglichen Blocks aufeinanderfolgender Nachrichten von Entwickelnden. So kann der implizite Modus ein Präfix wiederverwenden, das mit einer früheren Nachricht endet, ohne dass dort explizite Breakpoints gesetzt wurden.
Modellgeneration
Caching-Modus

Implizite Breakpoints werden bei der letzten geeigneten Nachricht von Nutzenden gesetzt.

Verborgenes SystemWerkzeugeEntwickelndeKontextverlaufFolgenachrichtEingabe aus dem CacheEingabe ohne Cache-Nutzung
Mindestlänge für das Caching (modellabhängig)

Anfrage 1

12,000 Eingabe-Token
3,000 Token(zur Veranschaulichung)

Anfrage 2

15,000 Eingabe-Token
3,000 Token(zur Veranschaulichung)
0
2.5k
5k
7.5k
10k
12.5k
15k
17.5k
20k
Eingabe-Token (einschließlich verborgener Token zur Veranschaulichung)
15,000
Letzter übereinstimmender Breakpoint
3,000
Verborgene Token
=
12,000
Gemeldete Token aus dem Cache

Cache-Lebensdauer

Cache-Einträge werden nicht unbegrenzt gespeichert. Eine spätere Anfrage kann ein zwischengespeichertes Präfix nur wiederverwenden, solange der zugehörige Eintrag verfügbar ist. Bei der Wiederverwendung beginnt die Lebensdauer erneut, ohne dass weitere Gebühren für das Schreiben in den Cache anfallen. Die Lebensdauer und die Aufbewahrungseinstellungen hängen vom Modell ab.

Cache-Speicherort

Zwischengespeicherte Zustände liegen auf einzelnen Rechnern. Bei mehr als 15 Anfragen pro Minute können Anfragen auf andere Rechner umgeleitet werden. Eine Anfrage kann ein zwischengespeichertes Präfix nur dann wiederverwenden, wenn sie einen Rechner mit einem passenden, noch nicht abgelaufenen Eintrag erreicht. Für die Wiederverwendung des Caches ist es daher wichtig, Anfragen an den richtigen Rechner zu leiten.

Caches werden nicht organisationsübergreifend geteilt und können nicht über die Grenzen regionaler Verarbeitung hinweg wiederverwendet werden.

OpenAI übernimmt das Routing automatisch. Innerhalb einer Organisation und Verarbeitungsregion hängt das Routing für ein bestimmtes Modell von folgenden Faktoren ab:

  • Der aktuellen Rechnerauslastung und der verfügbaren Kapazität.
  • Einem Hash der ersten Token nach den verborgenen OpenAI-Inhalten, einschließlich etwaiger Werkzeugdefinitionen. Wie viele Token in den Hash einfließen, hängt vom Modell ab.
  • Einem bereitgestellten prompt_cache_key, der die Cache-Wiederverwendung zwischen Gruppen von Anfragen trennt und bei Modellen vor GPT-5.6 hilft, das Cache-Routing zu optimieren.

Modellunterschiede im Überblick

VerhaltenGPT-5.6 und neuere ModelleGPT-5.5 und GPT-5.5 ProAndere frühere Modelle
Implizite BreakpointsAm Ende der letzten geeigneten Nachricht.In regelmäßigen Abständen von 2.048 Token.In regelmäßigen, modellabhängigen Abständen.
Explizite BreakpointsUnterstütztNicht unterstütztNicht unterstützt
prompt_cache_keyOptional zur getrennten Erfassung und Abrechnung der Cache-NutzungVerwende einen stabilen Schlüssel, um das Cache-Routing zu optimierenVerwende einen stabilen Schlüssel, um das Cache-Routing zu optimieren
Mindestlänge eines zwischenspeicherbaren Präfixes1.024 sichtbare EingabetokenHängt von den Anfrageeinstellungen abHängt von den Anfrageeinstellungen ab
Ausgewiesene Anzahl zwischengespeicherter TokenExakt bis zur geeigneten Grenze, ohne verborgene TokenOhne verborgene Token, auf ein Vielfaches von 128 abgerundetOhne verborgene Token, auf ein Vielfaches von 128 abgerundet
Gebühr für das Lesen aus dem CacheDas 0,1-Fache des Tarifs für nicht zwischengespeicherte EingabetokenModellabhängiger Tarif für zwischengespeicherte EingabetokenModellabhängiger Tarif für zwischengespeicherte Eingabetoken
Gebühr für das Schreiben in den CacheDas 1,25-Fache des Tarifs für nicht zwischengespeicherte EingabetokenKeine zusätzliche Gebühr für das Schreiben in den CacheKeine zusätzliche Gebühr für das Schreiben in den Cache
Steuerung der Cache-Lebensdauerprompt_cache_options.ttlprompt_cache_retentionprompt_cache_retention
Unterstützte Aufbewahrungswerte"30m"Nur "24h""in_memory" oder "24h"*
Cache-LebensdauerMindestens 30 Minuten nach dem letzten Schreibvorgang oder der letzten WiederverwendungIn der Regel etwa 30 Minuten, bis zu 24 StundenBei in_memory in der Regel 5 bis 10 Minuten nach der letzten Aktivität, bei 24h bis zu 24 Stunden

* Verlängerte Aufbewahrung wird von gpt-5.5, gpt-5.5-pro, gpt-5.4, gpt-5.2, gpt-5.1-codex-max, gpt-5.1, gpt-5.1-codex, gpt-5.1-codex-mini, gpt-5.1-chat-latest, gpt-5, gpt-5-codex und gpt-4.1 unterstützt.

Bei Modellen vor GPT-5.6 hängt die Mindestlänge zwischenspeicherbarer Eingaben von den Anfrageeinstellungen ab. Dazu gehören Werkzeuge, Bilder, Ausgabeschemas, Reasoning-Aufwand und Ausführlichkeit.

ChatGPT bitten, die Mindestlänge für das Caching meiner Anfrage zu ermitteln

So optimierst du Prompt-Caching

Achte vor allem darauf, den Gesprächsverlauf beizubehalten, Werkzeugdefinitionen stabil zu halten und festzulegen, an welchen Stellen zwischengespeichert wird. Verwende bei GPT-5.6 und neueren Modellen prompt_cache_options.mode und prompt_cache_breakpoint, um Cache-Breakpoints zu steuern. Optional kannst du auch einen prompt_cache_key verwenden, wenn deine Anwendung die Cache-Nutzung für einzelne Kundinnen und Kunden getrennt erfassen und abrechnen muss. Verwende bei Modellen vor GPT-5.6 einen stabilen prompt_cache_key, um das Cache-Routing für Anfragen mit einem gemeinsamen wiederverwendbaren Präfix zu optimieren.

ChatGPT bitten, mein Prompt-Caching zu optimieren

Beispiele

Die folgenden Beispiele gelten für GPT-5.6 und neuere Modelle.

Stolperfallen

Häufig gestellte Fragen