时间:2026年7月23日
地点:美国旧金山
人物:OpenAI公司
事件详情:2026年7月23日,OpenAI通过官方X账号正式宣布,ChatGPT桌面应用上线语音模式。用户可通过语音控制电脑,并指挥ChatGPT Work或Codex中运行的多个智能体协同工作。该功能由GPT-Live全双工语音模型驱动,支持同时说话、聆听以及在应用内协调任务,全球用户当日开始陆续收到更新,付费用户可解锁GPT-5.6 Sol ultra模式处理复杂多智能体语音任务,免费用户可通过Luna模型获得流畅的日常语音交互体验。
背景:2026年7月8日,OpenAI发布GPT-Live全双工语音模型并逐步推送至ChatGPT Voice。GPT-Live具备同时听说、可被打断等全双工交互能力,支持深度任务委托机制——前台保持流畅语音交互的同时,后台可并行处理联网搜索、复杂推理等任务。2026年7月10日,OpenAI将Codex正式并入ChatGPT桌面端,ChatGPT正式从聊天工具转变为能执行完整工作流的全能生产力载体。此次桌面端语音+多智能体功能的整合,是GPT-Live在企业级生产力场景的关键落地,标志着ChatGPT从对话工具进化为可执行的桌面智能体调度平台。
影响:
- 推动ChatGPT从对话工具向操作系统级智能体调度平台升级——语音成为指挥AI执行多步骤任务的新入口,重塑人机交互范式,使纯语音操控多智能体协同工作成为现实
- 巩固OpenAI在AI智能体赛道的先发优势——通过桌面+语音+多智能体的组合壁垒,挤压Anthropic、谷歌等竞品的差异化空间,进一步强化GPT-Live的全双工语音领先优势
- 加速AI语音交互从消费场景向企业生产力场景渗透——Codex编程智能体与ChatGPT Work协同,通过单一语音指令即可调度跨应用、跨设备的复杂工作流,进一步打开AI员工商业化空间
- 降低智能体使用门槛——用户无需学习复杂操作流程,自然语言+语音即可完成多智能体调度,推动AI Agent在中小企业的规模化落地
总结:ChatGPT桌面版语音控制多智能体功能的上线,是OpenAI模型+智能体+界面三层战略的集大成落地。借助GPT-Live的全双工语音能力和后台任务委托机制,用户首次可通过纯语音方式调度多个AI智能体完成跨应用、跨设备的复杂工作流,标志着AI正式从对话工具迈入语音操控的智能体操作系统时代。该功能将语音确立为下一代AI Agent的核心交互入口,有望加速智能体技术在编程、办公、企业服务等垂直领域的全面渗透。
参考来源:
- https://x.com/OpenAI/status/2080378182469857576
- https://help.openai.com/
- https://www.ithome.com/0/980/471.htm
- https://m.blog.csdn.net/w776341482/article/details/162785025
- https://blog.csdn.net/debug_fan/article/details/162738947
- https://k.sina.cn/article_7879848900_1d5acf3c4068035wto.html









