GPT-Live 负责语音对话,后端智能体则负责查找信息、使用工具和完成任务。它可以一边说话一边聆听,这种能力称为 全双工。将工作交给后端称为 委派:后端执行工作期间,对话仍可继续。
例如,用户可以询问订单情况,在后端查询订单状态时补充细节,并在结果就绪后听取结果。您可以独立于语音模型选择后端模型或智能体;Realtime 则使用同一个模型处理语音、推理和工具选择。
了解两个组成部分
- GPT-Live 负责对话。 它聆听、说话,并决定何时向后端寻求帮助。请为它提供简短的提示,说明对话风格和委派时机。
- 后端负责处理委派的任务。 使用 Responses 委派时,请选择受支持的 Responses 模型。使用客户端委派时,可连接您的应用运行的任何模型、智能体执行框架或服务。后端进行推理、使用工具,并返回结果,由 GPT-Live 传达。请将详细指令、业务规则和工具工作流放在后端。
您的应用负责管理权限、确认、私有函数执行和持久化任务状态。打断语音不会自动取消后端工作。请参阅语音智能体,比较 GPT-Live、Realtime 和链式语音应用。
选择后端运行方式
如果托管后端符合需求,请从 Responses 委派 开始:GPT-Live 调用您配置的 Responses 模型,提供对话上下文,并返回结果。如果您的应用需要控制后端执行、上下文或传给 GPT-Live 的结果,请选择 客户端委派。
有关比较和配置详情,请参阅选择委派模式。请在创建会话时选择模式;如需更改模式,请启动新会话。
连接您的第一个会话
请从GPT-Live WebRTC 快速入门开始。其中的浏览器和服务器示例连接了麦克风输入与扬声器输出,并使用支持网页搜索的 Responses 后端。
您需要一个麦克风、一个通过 HTTPS 或 localhost 提供的浏览器页面,以及一台持有 OpenAI 项目 API 密钥的可信服务器。请将密钥保留在服务器上。
- 编写简短的对话提示,告诉 GPT-Live 何时向后端寻求帮助。
- 按照快速入门指南连接浏览器的麦克风、音频播放和事件通道。您的服务器负责创建会话,并将浏览器的连接提议换取应答。
- 等待
session.started,然后说话并听取回复。提出一个需要最新信息才能回答的问题,试用网页搜索后端。 - 结束对话并关闭会话,以收集最终用量并释放连接。
请检查语音对话和后端结果。会话启动事件可确认启动成功;听取回复和检查搜索结果则分别验证应用的不同部分。
GPT-Live 语音会话按时长计费,以秒为单位。当前费率请参阅模型定价。后端模型和工具用量单独计费。有关用量核算和降低成本的方法,请参阅成本优化。
选择连接方式
- WebRTC 适用于浏览器语音应用。媒体轨道传输音频,数据通道传输 JSON 事件。
- WebSockets 适用于服务端音频集成。主套接字传输音频和控制事件。
- 服务端控制 用于让后端访问现有会话。旁路连接传输事件,音频仍通过主连接传输。
- 电话与 SIP 介绍电话集成路径并提供服务商相关指南。
合作伙伴集成
对于使用 LiveKit、 Twilio、 Telnyx 或 Daily/Pipecat 构建的应用,请先阅读合作伙伴集成概览,为您现有的媒体传输路径选择连接方式。
继续开发
- 请参阅GPT-Live 提示词,设定对话风格和委派行为。
- 请参阅委派与工具,接入工具并降低后端延迟。
- 请参阅管理会话,管理上下文、转录文本和会话生命周期。
- 请参阅迁移到 GPT-Live,为您的 Realtime 智能体或文本智能体选择迁移路径。
- 请参阅评测语音智能体,测试对话和任务结果。