ChatGPT桌面版接入语音模式:动口不动手的AI办公时代来了

AI资讯3天前发布 EdgeClaw
2 00

7月24日,OpenAI宣布对ChatGPT桌面应用进行重大升级,正式引入由GPT-Live模型驱动的ChatGPT Voice模式。新版应用已与Codex完成合并,用户可以在聊天(Chat)、办公(Work)和编程(Codex)三大板块中,通过语音方式发起、检查或调整任务,实现真正的多线程工作协同。

ChatGPT桌面应用语音交互界面概念图,展示玻璃拟态风格的全双工语音功能

这次升级的技术底座是GPT-Live全双工语音模型。与此前的语音识别功能不同,GPT-Live能够同时聆听和说话,让AI对话体验更接近真人交流。OpenAI在声明中表示,未来用户只需口述需求,ChatGPT就能根据思路快速推进多项任务。

从单轮对话到多任务并行

ChatGPT Voice的核心变化在于打破了”一问一答”的传统模式。新版支持从单一对话中启动多个工作流程,AI在后台执行任务的同时,用户可以继续交谈。

以商务旅行为例:你可以要求ChatGPT检查日历查找冲突、梳理收件箱查看航班变更、准备会议记录——而你在冲咖啡或处理其他事情。这种”口述即执行”的体验,本质上是将AI从信息助手升级为任务执行代理。

AI智能体多任务并行处理流程示意图,体现桌面办公自动拆解执行能力

桌面AI办公的竞争加速

几乎同一时间,腾讯WorkBuddy也宣布了重要动作——正式上架鸿蒙电脑应用市场,成为鸿蒙电脑首款第三方桌面办公智能体。WorkBuddy接入了腾讯混元Hy3、MiniMax、Kimi、DeepSeek、GLM等多家大模型,支持复杂任务自主拆解与闭环执行,2026年6月月访问量已突破2000万。

桌面AI办公赛道正在快速升温。Google在7月22日推出了Gemini 3.6 Flash,专注降低编码和数据分析的token消耗。Anthropic也在测试Claude驱动的Managed Projects功能,让AI自主组织任务、维护上下文并执行定时工作。

语音交互的下一步

从产品演进路径看,OpenAI从2024年首次为ChatGPT引入语音识别,到如今实现全双工语音交互,每一步都在缩短人与AI之间的距离。语音模式不再是”输入方式的补充”,而是正在成为桌面AI的核心交互范式。

值得关注的是,Anthropic也在为Claude的语音模式增加Opus和Sonnet模型选项,替代此前仅使用的Haiku轻量模型。这意味着语音交互的”智力水平”正在向旗舰模型看齐,未来用户通过语音下达复杂指令时,AI的理解和执行能力将大幅提升。

当AI办公工具从”打字输入”进化到”口述指挥”,工作方式的变化才刚刚开始。

© 版权声明

相关文章