For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Hauptnavigation

Flex-Verarbeitung

Optimiere deine Kosten mit Flex-Verarbeitung.

Flex-Verarbeitung senkt die Kosten für Anfragen an Responses oder Chat Completions. Dafür musst du längere Antwortzeiten und gelegentlich nicht verfügbare Ressourcen in Kauf nehmen. Sie eignet sich ideal für Aufgaben außerhalb des Produktivbetriebs oder mit niedrigerer Priorität, etwa Modellevaluierungen, Datenanreicherung und asynchrone Workloads.

Token werden zu den Tarifen der Batch API abgerechnet. Durch Prompt-Caching erhältst du zusätzliche Rabatte.

Flex-Verarbeitung befindet sich in der Betaphase und ist nur für eine begrenzte Auswahl an Modellen verfügbar. Die unterstützten Modelle findest du auf der Preisseite.

API-Nutzung

Um Flex-Verarbeitung zu nutzen, setze den Parameter service_tier in deiner API-Anfrage auf flex:

Beispiel für Flex-Verarbeitung
from openai import OpenAI

client = OpenAI(
    # increase default timeout to 15 minutes (from 10 minutes)
    timeout=900.0
)

# you can override the max timeout per request as well
response = client.with_options(timeout=900.0).responses.create(
    model="gpt-6-astra",
    instructions="List and describe all the metaphors used in this book.",
    input="<very long text of book here>",
    service_tier="flex",
)

print(response.output_text)

Zeitüberschreitungen bei API-Anfragen

Da die Flex-Verarbeitung langsamer ist, kommt es bei Anfragen häufiger zu Zeitüberschreitungen. Beachte dazu folgende Hinweise:

  • Standard-Timeout: Für API-Anfragen mit einem offiziellen OpenAI SDK beträgt das Standard-Timeout 10 Minuten . Bei langen Prompts oder komplexen Aufgaben musst du dieses Timeout möglicherweise erhöhen.
  • Timeouts konfigurieren: Jedes SDK bietet einen Parameter, mit dem du dieses Timeout erhöhen kannst. In den Python- und JavaScript-SDKs heißt er timeout, wie in den Codebeispielen oben gezeigt.
  • Automatische Wiederholungsversuche: Die OpenAI SDKs wiederholen Anfragen, die den Fehlercode 408 Request Timeout zurückgeben, automatisch zweimal, bevor sie eine Ausnahme auslösen.

Fehler wegen nicht verfügbarer Ressourcen

Bei der Flex-Verarbeitung stehen manchmal nicht genügend Ressourcen zur Verfügung, um deine Anfragen zu bearbeiten. In diesem Fall wird der Fehlercode 429 Resource Unavailable zurückgegeben. Dabei entstehen dir keine Kosten.

Für den Umgang mit Fehlern wegen nicht verfügbarer Ressourcen kommen folgende Strategien infrage:

  • Anfragen mit exponentiellem Backoff wiederholen: Exponentielles Backoff eignet sich für Workloads, die Verzögerungen tolerieren, und soll die Kosten minimieren. Deine Anfrage kann so zu einem späteren Zeitpunkt abgeschlossen werden, wenn wieder mehr Kapazität verfügbar ist. Details zur Implementierung findest du in diesem Cookbook.

  • Anfragen mit Standardverarbeitung wiederholen: Implementiere für Fehler wegen nicht verfügbarer Ressourcen eine Wiederholungsstrategie mit Standardverarbeitung, wenn du für deinen Anwendungsfall gelegentlich höhere Kosten in Kauf nehmen kannst, um den erfolgreichen Abschluss sicherzustellen. Setze dazu service_tier in der wiederholten Anfrage auf auto oder entferne den Parameter service_tier, um den Standardmodus des Projekts zu verwenden.