For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Hauptnavigation

Zentrale Konzepte

Zentrale Konzepte für die Arbeit mit der OpenAI API.

Bei OpenAI ist der Schutz von Nutzerdaten ein grundlegender Bestandteil unserer Mission. Wir trainieren unsere Modelle nicht mit Ein- und Ausgaben über unsere API. Mehr erfährst du auf unserer Seite zum Datenschutz bei der API.

Modelle zur Textgenerierung

Die Modelle zur Textgenerierung von OpenAI (oft als generative vortrainierte Transformer oder kurz „GPT“-Modelle bezeichnet), etwa gpt-6-astra und gpt-5.6-terra, wurden darauf trainiert, natürliche und formale Sprache zu verstehen. Diese Modelle erzeugen Textausgaben als Antwort auf ihre Eingaben. Die Eingaben werden auch als „Prompts“ bezeichnet. Mit einem Prompt „programmierst“ du im Grunde ein Modell. Dazu gibst du ihm in der Regel Anweisungen oder Beispiele dafür, wie es eine Aufgabe erfolgreich erledigen soll. GPT-Modelle lassen sich für viele verschiedene Aufgaben einsetzen, etwa zum Erstellen von Inhalten oder Code, zum Zusammenfassen, für Gespräche, zum kreativen Schreiben und vieles mehr. Mehr erfährst du in unserem einführenden Leitfaden zur Textgenerierung und in unserem Leitfaden zum Prompt Engineering.

Embeddings

Ein Embedding stellt Daten (z. B. einen Text) als Vektor dar, der Aspekte ihres Inhalts und/oder ihrer Bedeutung bewahren soll. Daten, die sich in irgendeiner Weise ähneln, haben tendenziell Embeddings, die näher beieinanderliegen als die Embeddings nicht verwandter Daten. OpenAI bietet Modelle für Text-Embeddings an, die eine Zeichenfolge als Eingabe erhalten und einen Embedding-Vektor ausgeben. Embeddings eignen sich unter anderem für die Suche, das Clustering, Empfehlungen, die Erkennung von Anomalien und die Klassifizierung. Mehr über Embeddings erfährst du in unserem Leitfaden zu Embeddings.

Token

Modelle zur Textgenerierung und für Embeddings verarbeiten Text in Abschnitten, die als Token bezeichnet werden. Token stehen für häufig vorkommende Zeichenfolgen. Beispielsweise wird die Zeichenfolge " tokenization" in " token" und "ization" zerlegt, während ein kurzes, häufiges Wort wie " the" als einzelnes Token dargestellt wird. Beachte, dass in einem Satz das erste Token jedes Wortes in der Regel mit einem Leerzeichen beginnt. Mit unserem Tokenizer-Tool kannst du bestimmte Zeichenfolgen testen und sehen, wie sie in Token umgewandelt werden. Als grobe Faustregel gilt: Bei englischem Text entspricht 1 Token ungefähr 4 Zeichen oder 0,75 Wörtern.

Beachte folgende Einschränkung: Bei einem Modell zur Textgenerierung dürfen der Prompt und die generierte Ausgabe zusammen die maximale Kontextlänge des Modells nicht überschreiten. Bei Modellen für Embeddings, die keine Token ausgeben, muss die Eingabe kürzer sein als die maximale Kontextlänge des Modells. Die maximalen Kontextlängen der einzelnen Modelle zur Textgenerierung und für Embeddings findest du in der Modellübersicht.