模型

GPT-Live:把实时语音与任务协调接入 ChatGPT

GPT-Live 为 ChatGPT Voice 提供自然语音轮替、任务发起、进度检查与持续调整能力。

OpenAI GPT-Live voice-ai multimodal ai-safety OpenAI GPT-Live 为 ChatGPT Voice 提供自然语音轮替、任务发起、进度检查与持续调整能力。

Frontmatter

结构化元信息

实体类型
模型
主分类
模型
产品状态
已上线
开放状态
闭源
信息截至
2026-08-12

1. 一句话结论

GPT-Live 为 ChatGPT Voice 提供模型能力,让用户在 Chat、Work 和 Codex 中通过语音讨论想法、发起任务、查看进度或改变方向。[S1] 官方文档确认它支持自然轮替与中途打断,并可在较长任务运行时继续接受口头指令。[S1] 它适合免手持协作,但背景噪声、敏感信息和错误执行仍需专门验收。

2. 项目定位

GPT-Live 在当前产品中的重点不是替代单次语音转写,而是把语音作为持续协作入口。Voice 可以启动独立任务、查询已有任务状态并发送后续指令,再把进度、阻塞和结果带回语音会话。[S1] 这使“说出要求”和“监督长任务”连在一起,但实际任务仍受对应 Chat、Work 或 Codex 权限约束。

3. 核心能力

用户可以在回复期间打断 ChatGPT、追问或更换方向;当 ChatGPT 已启动工作时,也能继续通过语音检查和调整。[S1] 在 macOS 上,经用户开启并授予权限后,Voice 还可取得前台窗口的 appshot 作为上下文;组织可以关闭该能力。[S1] 任务调度与屏幕上下文是两个独立风险面,部署时应分别设置权限。

4. 适用场景

适合免手持助手、语言练习、无障碍交互、客服前台和需要边说边查的工作。最佳试点应是意图可枚举、错误可撤销的低风险任务,例如查询知识库、收集表单信息或安排待确认事项。涉及付款、医疗判断、法律意见、设备控制和身份核验时,必须转人工或要求明确二次确认。

5. 产品与技术边界

官方文档所述入口以 ChatGPT 桌面应用为主,Plus、Pro、Business、Edu 和 Enterprise 的可用性还取决于滚动开放和工作区设置;配对桌面主机后也可通过 iOS Remote 使用。[S1] 语音会话只能同时运行一个,并使用单独、依套餐计算的额度;通过 Voice 启动的任务仍消耗 Codex 使用预算。[S1]

6. 商业与开放状态

模型权重未开放,服务由 OpenAI 托管。产品可用性、额度和工作区控制可能变化,因此相同测试不能假定长期结果一致。[S1] 团队需要记录应用版本、套餐、任务类型、权限、语音指令和失败回退,并在启用前确认费用与数据处理条款。对企业环境,还应明确谁能开启 Voice 与屏幕上下文。

7. 同类对比

与只把一段录音转成提示词的语音听写相比,GPT-Live 面向实时往返对话,还能协调持续运行的任务。[S1] 与键盘操作相比,它减少切换界面的动作,但对精确路径、代码片段、密钥和复杂审批仍不一定更可靠。选择标准应是端到端任务完成率、打断恢复、可追溯性与成本,而不只是主观“更像真人”。

8. 主要风险

连续语音会放大误听、抢话、背景人声采集和错误工具调用风险。屏幕 appshot 还可能包含可见范围之外的辅助文本,官方明确提醒避免共享含敏感信息的窗口。[S1] OpenAI 另行发布 GPT-Live 系统卡并持续修订安全评估结果。[S2] 产品方仍需提供录音提示、静音、删除、人工接管和操作确认。

9. 试点与验收

建立包含安静环境、街道噪声、不同口音、长停顿、重叠说话和敏感请求的测试集。记录首声延迟、错误打断、意图识别、后台任务耗时、事实准确率、工具误调用和人工接管率。对每个可执行动作做“双确认”测试;只有高风险动作零越权且普通任务表现稳定,才进入小流量上线。

10. 来源与更新时间

研究更新时间为 2026-08-12。模型、套餐、API 与后端委派策略都可能变化,上线前需复查发布页、系统卡和实际控制台。

  • [S1] ChatGPT Learn 官方文档,说明 GPT-Live 驱动的 Voice、任务协调、权限、入口与限制|链接
  • [S2] OpenAI Deployment Safety Hub:GPT-Live System Card|链接