For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Hauptnavigation

Audio in Chat Completions

Erweitere eine bestehende Chat Completions-Anwendung um Audioeingabe und -ausgabe.

Wenn du bereits eine textbasierte LLM-Anwendung mit dem Chat Completions-Endpunkt nutzt, möchtest du sie vielleicht um Audiofunktionen erweitern. Unterstützt deine Chat-Anwendung beispielsweise Texteingaben, kannst du Audioeingabe und -ausgabe hinzufügen: Nimm audio in das Array modalities auf und verwende ein Audiomodell wie gpt-audio-1.5.

Die Dokumentation der Responses API beschreibt derzeit Text- und Bildeingaben mit Textausgaben. Verwende für diesen Audiochat-Anwendungsfall Chat Completions mit einem Modell, das Audio unterstützt.

Erstelle eine menschlich klingende Audioantwort auf einen Prompt
import { writeFileSync } from "node:fs";
import OpenAI from "openai";

const openai = new OpenAI();

// Generate an audio response to the given prompt
const response = await openai.chat.completions.create({
  model: "gpt-audio-1.5",
  modalities: ["text", "audio"],
  audio: { voice: "alloy", format: "wav" },
  messages: [
    {
      role: "user",
      content: "Is a golden retriever a good family dog?",
    },
  ],
  store: true,
});

// Inspect returned data
console.log(response.choices[0]);

// Write audio data to a file
writeFileSync(
  "dog.wav",
  Buffer.from(response.choices[0].message.audio.data, "base64"),
  { encoding: "utf-8" }
);