7月23日,一则架构调整消息在AI圈传开:腾讯宣布将混元大语言模型部门与多模态模型部门合并,成立全新的”基础模型部”。整合后由首席AI科学家姚顺雨统一管理,统筹文本、图像、视频、语音、3D等全模态模型研发。
这不是简单的人事调动,而是腾讯AI战略从”多路并进”转向”统一基座”的信号弹。
为什么选择合并?
过去两年,腾讯在AI领域维持多团队并行的研发模式。混元大语言模型团队专注文本理解和生成,多模态团队分别攻关图像、视频、语音和3D方向。这种架构在早期有利于快速试错,各团队独立迭代。
问题也随之而来。当文生视频需要语言理解能力、语音模型需要视觉上下文时,协作成本急剧上升。数据格式不统一,训练流程各有一套,算力分配需要反复协调。行业竞争已经不允许大厂继续”散装”作战。

谷歌Gemini从立项就采用原生多模态架构,所有模态在同一框架下联合训练。Meta的Llama系列也在加速向多模态演进。竞争对手已经在底层架构上实现统一,分散的团队结构变成了效率瓶颈。
姚顺雨与统一基座思路
姚顺雨2024年加入腾讯担任首席AI科学家,技术背景横跨自然语言处理、计算机视觉和多模态学习,恰好契合”统一基座”方向。
由他统管基础模型部,意味着腾讯不再将文本模型和视觉模型视为两条独立赛道,而是探索同时处理所有模态的统一架构。学术界和产业界越来越相信,真正强大的AI不应该被模态边界限制。
统一基座的核心优势在于能力迁移。底层架构能处理图像和音频的模型,在多模态任务上往往优于拼凑式方案,不同模态的数据还能相互增强训练效果。
行业集体转向
腾讯并非个例。2026年上半年,全球头部AI公司的组织架构都在向”统一化”靠拢。OpenAI年初将GPT系列和DALL-E、Sora等视觉生成团队纳入同一技术委员会管理。谷歌DeepMind坚持”一个模型解决所有问题”,Gemini每次迭代都是全模态同步升级。
趋势背后的逻辑很直接:用户不按模态分类使用AI。你对着手机说话时,期待它同时理解语音、看懂图片、生成文字回复,甚至帮你操作应用。这种无缝体验需要底层模型具备全模态能力。

挑战与机遇并存
合并只是第一步。多模态统一训练对算力需求是指数级增长的,文本、图像、音频、视频的数据分布差异巨大,如何在同一模型中让它们互相促进而非干扰,是工程层面的核心难题。
腾讯的方案是基础模型部专注底层能力建设,微信、QQ、腾讯文档等业务线基于统一基座做场景适配。”中台+前台”模式保证底层一致性,同时保留业务灵活性。
混元大模型在中文理解和多模态能力上已有积累,统一架构可加速能力融合升级。商业化层面,统一基座意味着企业客户可以通过一个API获取全模态能力,大幅降低接入门槛。
AI竞争的下半场,比的不是谁的单一模态更强,而是谁能把多种模态真正融为一体。








