转录将语音转换为文本。请根据音频是已录制完成还是正在实时传入,选择相应的工作流程。每种工作流程都有一个推荐的入门模型。
选择转录工作流程
| 工作流程 | 适用场景 | 推荐模型 |
|---|---|---|
| 文件转录 | 您有已录制完成的音频,或范围明确的音频请求。上传文件后接收最终转录文本,也可以在处理文件时以流式方式接收文本。 | gpt-transcribe |
实时转录 | 您有来自麦克风、通话或其他来源的实时音频流,需要在语音传入时获取文本。 | gpt-live-transcribe |
是否流式输出与是否使用实时音频是两个独立的选择。您可以流式接收已录制完成的文件的转录文本,无需开启 Realtime 会话。只有在音频实时传入或需要持久连接时,才使用 Realtime。
选择专项功能
请先使用适合您工作流程的推荐模型。只有在应用需要默认模型不具备的功能时,才切换模型。
| 如果您需要 | 请使用 |
|---|---|
| 带有说话人标签的转录文本 | 使用 gpt-4o-transcribe-diarize 进行文件转录。 |
词级时间戳或 srt 和 vtt 字幕 | 使用 whisper-1 进行文件转录。 |
| 将已录制完成的音频翻译成英语 | 通过音频翻译端点使用 whisper-1。 |
| 检测到的输入语言 | 使用 gpt-transcribe 进行文件转录。 |
| 通过 WebSocket 转录已提交的轮次 | 使用 gpt-transcribe 进行实时转录。 |
现有集成可以在受支持的场景中继续使用 gpt-4o-transcribe、gpt-4o-mini-transcribe 或 gpt-realtime-whisper。对于新的转录集成,不建议从这些模型开始。
请参阅转录定价,并在迁移生产环境流量之前,使用有代表性的音频测试推荐方案。
提高转录质量
gpt-transcribe 和 gpt-live-transcribe 接受三类上下文:
prompt:以自由文本形式描述录音的上下文,例如主题或场景。keywords:音频中可能出现的具体词语,例如产品名称、药品名称或首字母缩略词。languages:当录音可能包含多种语言时,提供预期输入语言的列表。
这些输入仅用于提供与音频相关的上下文,请勿重复描述转录任务。关键词只是提示,并非必须输出的内容。只有当音频中出现某个关键词时,转录文本才应包含该词。
这些模型使用 languages 字段,而非单数形式的 language 字段。接受单一语言提示的现有转录模型继续使用 language。
当 gpt-transcribe 在 Realtime API 会话中转录输入音频,或在专用转录会话中运行时,它会自动将此前已转录的轮次用作上下文。
使用有代表性的音频进行测试
请在应用将会遇到的音频条件下测试转录效果,包括:
- 目标语言、口音以及语言混用模式。
- 背景噪声、麦克风质量和电话音频。
- 名称、数字、日期、字母数字字符串和领域术语。
- 简短话语、长录音和被打断的语音。
请跟踪对应用有实际影响的错误,而不要仅依赖词错误率。例如,在医疗保健工作流程中测试药品名称,或在客服工作流程中测试订单号。