For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Hauptnavigation

Kosten optimieren

Arbeite effizienter und senke deine Kosten.

Es gibt verschiedene Möglichkeiten, die Kosten bei der Nutzung von OpenAI-Modellen zu senken. Kosten und Latenz hängen meist zusammen: Weniger Token und Anfragen führen in der Regel zu einer schnelleren Verarbeitung. Die Batch API und die Flex-Verarbeitung von OpenAI bieten weitere Möglichkeiten, Kosten zu senken.

Kosten und Latenz

Um Latenz und Kosten zu senken, kannst du folgende Strategien nutzen:

  • Anfragen reduzieren: Begrenze die Anzahl der Anfragen, die zum Erledigen von Aufgaben nötig sind.
  • Token minimieren: Reduziere die Anzahl der Eingabetoken und optimiere die Modellausgaben so, dass sie kürzer ausfallen.
  • Ein kleineres Modell wählen: Nutze Modelle, die geringere Kosten und Latenz mit gleichbleibender Genauigkeit verbinden.

Mehr dazu erfährst du in unserem Leitfaden Latenz optimieren.

Batch API

Verarbeite Aufträge asynchron. Die Batch API bietet einfach zu nutzende Endpunkte, mit denen du mehrere Anfragen in einer einzigen Datei bündeln und einen Auftrag zur Stapelverarbeitung starten kannst, um diese Anfragen auszuführen. Während die Anfragen verarbeitet werden, kannst du den Status des Stapels abfragen. Nach Abschluss der Verarbeitung kannst du die gesammelten Ergebnisse abrufen.

Erste Schritte mit der Batch API →

Flex-Verarbeitung

Senke die Kosten für Chat Completions- oder Responses-Anfragen deutlich, indem du längere Antwortzeiten und gelegentlich nicht verfügbare Ressourcen in Kauf nimmst. Ideal für Aufgaben außerhalb des Produktivbetriebs oder mit niedrigerer Priorität, etwa Modellevaluierungen, Datenanreicherung oder asynchrone Workloads.

Erste Schritte mit der Flex-Verarbeitung →