构建新的语音对话应用,请从 GPT-Live 开始。它可以边说边听,并在后端智能体进行推理、使用工具或完成任务时,让对话继续进行。
按照 WebRTC 快速入门建立您的首次对话连接,然后编写一段简短的 Live 提示。如果您已有 Realtime 应用或文本智能体,请按照迁移到 GPT-Live 中的说明操作。
选择其他音频工作流程
如果您需要 Realtime API 的会话和工具模型,请使用该 API。如果您需要转录、翻译或语音生成,但不需要对话智能体,请选择下方的专用 API。
| 构建目标 | 从这里开始 | 您可以控制的内容 |
|---|---|---|
| 采用 Realtime 会话和工具模型的语音到语音智能体 | Realtime API | 音频轮次、会话状态、工具和打断。 |
| 现有文本智能体的语音交互界面 | 语音智能体 | 语音转文本、文本智能体工作流程,以及后续的文本转语音。 |
| 音频文件的转录文本 | 文件转录 | 文件上传、有明确边界的请求,以及支持的转录格式。 |
| 不含助手语音的实时字幕 | 实时转录 | 流式音频和增量转录事件。 |
| 连续语音翻译 | 实时翻译 | 专用翻译会话,而非语音智能体的轮次循环。 |
| 旁白或生成的语音 | 文本转语音 | 文本、音色和输出格式。 |
| 现有聊天应用中的音频输入或输出 | Chat Completions 中的音频 | 有明确边界的多模态聊天请求。 |
构建语音应用
参阅语音智能体以比较不同架构。先阅读 GPT-Live 或 Realtime 的提示词指南,再参考自定义音色、评估和成本优化的通用指南。各指南均会区分特定模型或 API 的行为。
选择连接方式
处理浏览器音频,请从 WebRTC 开始。构建服务器音频流水线,请使用 WebSockets。处理电话通话,请参阅电话与 SIP。服务器端控制连接可让受信任的后端观察并控制媒体会话。
请在各连接页面选择您使用的 API。使用相同的传输方式并不意味着 GPT-Live 和 Realtime 的握手、凭据或事件格式可以互换。有关前提条件和设置说明,请查看连接指南。
为现有应用添加音频功能
Chat Completions 示例现已移至 Chat Completions 中的音频。要开始构建浏览器语音智能体,请参阅 GPT-Live WebRTC 快速入门。