返回滚动近30天 Top30第013期 / 15
全球 / 多模态
GPT-Live-1 上线:语音可以边听边说,后端推理另接模型
Build more natural voice experiences with GPT‑Live‑1 in the API | OpenAI
GPT-Live-1 已进入 API,支持全双工语音,即说话时也能继续听取输入。
一分钟读懂
- GPT-Live-1 已进入 API,支持全双工语音,即说话时也能继续听取输入。
- 前端语音层收费0.05美元/分钟;复杂推理和工具任务可以交给另一个模型或 Agent 框架。
- 交互方式
- 全双工,边说边听
- 语音层价格
- 0.05美元 / 分钟
- 后端任务
- 推理和工具费用另计
发生了什么
GPT-Live-1 已进入 API,支持全双工语音:系统在说话的同时,也能继续接收用户的语音输入。这让打断、补充和轮流说话成为实时交互的一部分。
它主要负责前端语音交互,复杂推理和工具任务可以交给后端模型或 Agent 框架。前端语音层收费0.05美元/分钟,后端模型与工具的费用另算。
为什么值得关注
语音助手经常需要在说话途中接收修正。把实时交互和复杂任务处理分开后,开发者可以分别选择适合的模型,同时也需要处理两层之间的信息传递。
我的观察
语音体验不只取决于转写是否准确,也取决于何时该停、何时继续听。这一分工让语音交互和复杂任务可以分别选择模型。
可能带来的影响
对话可以更及时地接收修正
如果打断和任务交接表现稳定,用户有望更自然地修改要求;实际延迟与整体费用仍取决于所接入的后端。
还不知道什么
0.05美元并非完整系统总成本;后端模型和工具费用需要另算。
发布方主张
打断处理、延迟和对话自然度的提升来自官方评测及试用方反馈。
时间线
本次发布
实时语音开始采用前端对话与后端推理分工的方式。
原文仅给出日期,不补写具体时分。
收录:2026年9月12日 18:00 · 核验:2026年9月21日 00:57(UTC+8)
