For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegação principal

Áudio no Chat Completions

Adicione entrada e saída de áudio a um aplicativo existente que usa Chat Completions.

Se você já tem um aplicativo de LLM baseado em texto que usa o endpoint Chat Completions, talvez queira adicionar recursos de áudio. Por exemplo, se seu aplicativo de chat aceita entrada de texto, você pode adicionar entrada e saída de áudio: inclua audio no array modalities e use um modelo de áudio, como o gpt-audio-1.5.

A documentação da API Responses descreve atualmente entradas de texto e imagem com saídas de texto. Para esse padrão de chat com áudio, use Chat Completions com um modelo compatível com áudio.

Crie uma resposta em áudio com voz semelhante à humana a partir de um prompt
import { writeFileSync } from "node:fs";
import OpenAI from "openai";

const openai = new OpenAI();

// Generate an audio response to the given prompt
const response = await openai.chat.completions.create({
  model: "gpt-audio-1.5",
  modalities: ["text", "audio"],
  audio: { voice: "alloy", format: "wav" },
  messages: [
    {
      role: "user",
      content: "Is a golden retriever a good family dog?",
    },
  ],
  store: true,
});

// Inspect returned data
console.log(response.choices[0]);

// Write audio data to a file
writeFileSync(
  "dog.wav",
  Buffer.from(response.choices[0].message.audio.data, "base64"),
  { encoding: "utf-8" }
);