For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Hauptnavigation

Text in Sprache umwandeln

Erfahre, wie du Text in natürlich klingende Sprache umwandelst.

Die Audio API bietet einen speech-Endpunkt, der auf unserem Modell GPT-4o mini TTS (Text-to-Speech) basiert. Er verfügt über 11 integrierte Stimmen und ermöglicht dir Folgendes:

  • Einen geschriebenen Blogbeitrag vorlesen lassen
  • Gesprochene Audiodaten in mehreren Sprachen erzeugen
  • Audio per Streaming in Echtzeit ausgeben

Hier hörst du ein Beispiel mit der Stimme alloy:

Unsere Nutzungsrichtlinien verpflichten dich dazu, deine Nutzenden klar darauf hinzuweisen, dass die TTS-Stimme, die sie hören, KI-generiert ist und keine menschliche Stimme.

Schnellstart

Der speech-Endpunkt benötigt drei wesentliche Eingaben:

  1. Das Modell, das du verwendest
  2. Den Text, der in Audio umgewandelt werden soll
  3. Die Stimme, mit der die Ausgabe gesprochen wird

Hier ist ein einfaches Beispiel für eine Anfrage:

Gesprochene Audiodaten aus Eingabetext erzeugen
from pathlib import Path
from openai import OpenAI

client = OpenAI()
speech_file_path = Path(__file__).parent / "speech.mp3"

with client.audio.speech.with_streaming_response.create(
    model="gpt-4o-mini-tts",
    voice="coral",
    input="Today is a wonderful day to build something people love!",
    instructions="Speak in a cheerful and positive tone.",
) as response:
    response.stream_to_file(speech_file_path)

Standardmäßig gibt der Endpunkt die gesprochene Sprache als MP3 aus. Du kannst ihn jedoch so konfigurieren, dass er ein beliebiges unterstütztes Format ausgibt.

Text-to-Speech-Modelle

Verwende für intelligente Echtzeitanwendungen das Modell gpt-4o-mini-tts, unser neuestes und zuverlässigstes Text-to-Speech-Modell. Mit Prompts kannst du verschiedene Aspekte der Sprachausgabe steuern, darunter:

  • Akzent
  • Emotionale Bandbreite
  • Intonation
  • Stimmimitationen
  • Sprechgeschwindigkeit
  • Tonfall
  • Flüstern

Unsere weiteren Text-to-Speech-Modelle sind tts-1 und tts-1-hd. Das Modell tts-1 bietet eine geringere Latenz, allerdings bei geringerer Qualität als das Modell tts-1-hd.

Verfügbare Stimmen

Der TTS-Endpunkt bietet 13 integrierte Stimmen, mit denen du festlegen kannst, wie Text als Sprache wiedergegeben wird. Höre dir diese Stimmen in OpenAI.fm an und experimentiere mit ihnen. In unserer interaktiven Demo kannst du das neueste Text-to-Speech-Modell der OpenAI API ausprobieren. Die Stimmen sind derzeit für Englisch optimiert.

  • alloy
  • ash
  • ballad
  • coral
  • echo
  • fable
  • nova
  • onyx
  • sage
  • shimmer
  • verse
  • marin
  • cedar

Für die beste Qualität empfehlen wir marin oder cedar.

Welche Stimmen verfügbar sind, hängt vom Modell ab. Die Modelle tts-1 und tts-1-hd unterstützen eine kleinere Auswahl: alloy, ash, coral, echo, fable, onyx, nova, sage und shimmer.

Wenn du die Realtime API verwendest, beachte, dass die Auswahl der verfügbaren Stimmen etwas abweicht. Die aktuell verfügbaren Echtzeitstimmen findest du im Leitfaden zu Echtzeitgesprächen.

Audio in Echtzeit streamen

Die Speech API unterstützt Audiostreaming in Echtzeit mithilfe von Chunked Transfer Encoding. Dadurch kann die Audiowiedergabe beginnen, bevor die vollständige Datei erzeugt und bereitgestellt wurde.

Gesprochene Audiodaten aus Eingabetext direkt an deine Lautsprecher streamen
import asyncio

from openai import AsyncOpenAI
from openai.helpers import LocalAudioPlayer

openai = AsyncOpenAI()


async def main() -> None:
    async with openai.audio.speech.with_streaming_response.create(
        model="gpt-4o-mini-tts",
        voice="coral",
        input="Today is a wonderful day to build something people love!",
        instructions="Speak in a cheerful and positive tone.",
        response_format="pcm",
    ) as response:
        await LocalAudioPlayer().play(response)


if __name__ == "__main__":
    asyncio.run(main())

Für die kürzesten Antwortzeiten empfehlen wir wav oder pcm als Antwortformat.

Unterstützte Ausgabeformate

Das Standardantwortformat ist mp3. Es stehen aber auch andere Formate wie opus und wav zur Verfügung.

  • MP3: Das Standardantwortformat für allgemeine Anwendungsfälle.
  • Opus: Für Streaming und Kommunikation über das Internet, mit geringer Latenz.
  • AAC: Für digitale Audiokompression, bevorzugt von YouTube, Android und iOS.
  • FLAC: Für verlustfreie Audiokompression, bei Audiofans zur Archivierung beliebt.
  • WAV: Unkomprimierte WAV-Audiodaten, geeignet für Anwendungen mit geringer Latenz, da kein zusätzlicher Aufwand für die Dekodierung anfällt.
  • PCM: Ähnlich wie WAV, enthält jedoch die Roh-Samples mit 24 kHz (16 Bit, vorzeichenbehaftet, Little-Endian) ohne Header.

Unterstützte Sprachen

Das TTS-Modell orientiert sich bei der Sprachunterstützung weitgehend am Whisper-Modell. Whisper unterstützt die folgenden Sprachen und liefert gute Ergebnisse, obwohl die Stimmen für Englisch optimiert sind:

Afrikaans, Arabisch, Armenisch, Aserbaidschanisch, Belarussisch, Bosnisch, Bulgarisch, Katalanisch, Chinesisch, Kroatisch, Tschechisch, Dänisch, Niederländisch, Englisch, Estnisch, Finnisch, Französisch, Galicisch, Deutsch, Griechisch, Hebräisch, Hindi, Ungarisch, Isländisch, Indonesisch, Italienisch, Japanisch, Kannada, Kasachisch, Koreanisch, Lettisch, Litauisch, Mazedonisch, Malaiisch, Marathi, Maori, Nepali, Norwegisch, Persisch, Polnisch, Portugiesisch, Rumänisch, Russisch, Serbisch, Slowakisch, Slowenisch, Spanisch, Swahili, Schwedisch, Tagalog, Tamil, Thai, Türkisch, Ukrainisch, Urdu, Vietnamesisch und Walisisch.

Du kannst gesprochene Audiodaten in diesen Sprachen erzeugen, indem du den Eingabetext in der gewünschten Sprache bereitstellst.

Benutzerdefinierte Stimmen

Erstelle eine genehmigte benutzerdefinierte Stimme aus einer Aufnahme, in der die sprechende Person ihre Einwilligung erteilt, und einer passenden Audioprobe. Unter Benutzerdefinierte Stimmen findest du Informationen zu den Zugangsvoraussetzungen, Anforderungen an die Aufnahmen, Einwilligungsformulierungen und API-Anfragen.

Eine Stimme erstellen

Folge der Anleitung Eine benutzerdefinierte Stimme erstellen.

Eine Stimme bei der Sprachgenerierung verwenden

Übergib bei der Sprachgenerierung die ID der erstellten Stimme. Sieh dir dazu die Beispiele zur Sprachgenerierung an.

Übersicht zu Echtzeit und Audio

Wähle den passenden Ansatz für Sprachagenten, Übersetzung, Transkription und Sprachgenerierung.

Konzepte zu Audio und Sprache

Erfahre mehr über Audiomodalitäten, Aufgaben zur Sprachverarbeitung, Streaming und anfragebasierte APIs.