ChatGPT桌面应用Voice模式上线:动动嘴就能让AI帮你干活

AI资讯3小时前发布 aibotclaw
57 00

2026年7月24日,OpenAI宣布为ChatGPT桌面应用接入全新的Voice语音模式。这意味着,用户不再需要逐字敲击键盘,只需开口说话,就能让AI帮忙处理日程安排、整理邮件、准备会议记录等一系列工作任务。

此次升级由GPT-Live模型驱动,这是OpenAI最新发布的全双工语音模型,能够同时聆听和回应,让AI对话体验更接近真人交流。

三大板块全面支持语音交互

升级后的ChatGPT桌面应用已与Codex合并,形成三个核心板块:聊天(Chat)、办公(Work)和编程(Codex)。Voice模式横跨三个板块,用户可以在任何一个场景中通过语音发起、检查或调整任务。

聊天板块延续了此前的对话能力,语音模式下更适合头脑风暴和创意讨论。办公板块是这次升级的重点,OpenAI将其定位为”工作伙伴”,语音指令可以触发复杂的多步骤任务流。编程板块则面向开发者,用语音描述需求即可生成代码或调试程序。

ChatGPT Voice语音模式桌面应用界面概念图

多线程任务:边喝咖啡边让AI干活

Voice模式最大的突破在于支持多线程工作协同。用户可以从单一对话中启动多个工作流程,在AI后台处理任务的同时继续交谈。

OpenAI给出了一个商务旅行的场景:用户可以语音要求ChatGPT检查日历查找时间冲突、梳理收件箱确认航班变更、准备会议记录,这三项任务会在后台同步推进。整个过程用户只需说一次需求,剩下的交给AI完成。

这种”动口不动手”的工作方式,对于日程密集的知识工作者来说,可能会显著改变日常工作流程。

语音AI的竞争格局正在重塑

ChatGPT Voice并非第一个语音AI工具,但它的竞争力在于深度整合了OpenAI的完整生态。此前,Google的Gemini已经支持语音输入,国内的通义千问和百度搭子也在推进语音交互能力。

不过,能够在一个桌面应用中同时处理聊天、办公和编程三大场景的语音交互,ChatGPT目前是第一个。特别是办公板块的多线程任务能力,将语音AI从”问答工具”推向了”任务执行者”的角色。

值得关注的是,语音模式的安全和隐私问题也随之而来。在办公场景中,语音指令可能涉及敏感的商务信息,OpenAI需要在产品体验和数据保护之间找到平衡。

AI多线程任务协同工作流程示意图

对普通用户意味着什么

对于日常使用ChatGPT的用户来说,Voice模式的上线降低了使用门槛。不擅长打字的人群——比如老年用户或者移动办公场景下的职场人——可以通过语音更自然地和AI协作。

从技术演进来看,OpenAI从2024年首次引入语音识别,到如今的全双工语音模型,迭代速度明显加快。GPT-Live模型让AI不仅能”听懂”,还能实时回应和调整,这种交互体验正在模糊人与机器之间的边界。

可以预见,随着语音AI能力的成熟,未来的办公场景将越来越多地从”人机对话”转向”人机协作”,而键盘和屏幕可能不再是唯一的交互入口。

© 版权声明

相关文章