在API中使用GPT-Live-1构建更自然的语音体验
我们将在API中推出GPT-Live-1,为开发人员提供强大的自然语音模型,用于构建支持语音的应用程序和业务工作流程。 首次在ChatGPT中引入 、GPT-Live-1能够同时听和说,并且,作为 通过Codex和ChatGPT Work查看 (在新窗口中打开) ,可以将更深层次的推理和动作委托给与之配对的模型和工具。 对于GPT-Live-1的API版本,我们重点关注新功能,让开发人员能够围绕其用户、工作流程和目标引导和定制语音体验。GPT-Live-1的核心优势是流畅的中断处理,已经在产生业务影响:在早期评估中,Speak发现GPT-Live-1在语言导师做出回应之前为学习者提供了更多时间思考,与之前的回合制系统相比,中断减少了近80%。 GPT‑Live‑1在API中的主要优势: 传统的语音代理将语音到文本、推理模型和文本到语音缝合在一起。每次切换都会增加延迟,并创造更多失去时机、上下文或对话自然节奏的机会。开发人员通常是负责协调这些阶段的人, 包括 当有人中断、暂停或改变方向时会发生什么。 GPT-Live-1在单一模型中处理听和说,简化了语音层。以应对 中断 和认可,而 下放 更深层次的推理到后台。这可以让对话继续,而工作在后台进行。 开发人员选择对话背后的模型、工具和代理工具。例如,他们可能会将GPT-Live-1与Luna这样的模型配对,用于调度或订单更新等大容量任务,并使用Astra这样的模型来处理需要推理的复杂客户问题。这种灵活性使开发人员能够为每个任务匹配推理深度、速度和成本。 GPT-Live-1原生提供ASB成绩单和回复文本。它还提供了强大的比利时人
注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。
新闻来源
openai · 2026年9月10日 00:00