For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegación principal

Audio en Chat Completions

Agrega entrada y salida de audio a una aplicación existente de Chat Completions.

Si ya tienes una aplicación de LLM basada en texto que usa el punto de acceso de Chat Completions, quizá quieras agregar capacidades de audio. Por ejemplo, si tu aplicación de chat admite entrada de texto, puedes agregar entrada y salida de audio: incluye audio en el arreglo modalities y usa un modelo de audio, como gpt-audio-1.5.

La documentación de la API Responses actualmente describe entradas de texto e imágenes con salidas de texto. Para este patrón de chat con audio, usa Chat Completions con un modelo compatible con audio.

Crea una respuesta de audio que suene humana a partir de un prompt
import { writeFileSync } from "node:fs";
import OpenAI from "openai";

const openai = new OpenAI();

// Generate an audio response to the given prompt
const response = await openai.chat.completions.create({
  model: "gpt-audio-1.5",
  modalities: ["text", "audio"],
  audio: { voice: "alloy", format: "wav" },
  messages: [
    {
      role: "user",
      content: "Is a golden retriever a good family dog?",
    },
  ],
  store: true,
});

// Inspect returned data
console.log(response.choices[0]);

// Write audio data to a file
writeFileSync(
  "dog.wav",
  Buffer.from(response.choices[0].message.audio.data, "base64"),
  { encoding: "utf-8" }
);