9月22日凌晨,小米正式发布并开源MiMo-V2.6系列,包含全模态旗舰MiMo-V2.6-Pro与高效推理模型MiMo-V2.6-Flash两款原生全模态模型。Pro在Artificial Analysis Intelligence Index v4.3中拿到46.32分,超过Kimi K3的44分与GLM-5.3的45分,成为当前评分最高的开源权重模型。
榜首开源,距闭源仍差约7分
相较前代MiMo-V2.5-Pro的26分,Pro一口气提升了20分。不过官方同时给出参照系:Claude Fable 5.1与GPT-6 Astra同榜均为53分,开源榜首与闭源天花板之间还有约7分差距。Flash则定位智能、效率与成本的均衡点,性能全面超过上一代的V2.5-Pro。
6天30步,强化学习训练全程直播
这代产品被小米视为探索递归自我改进路径的关键一步:把算力投进可验证的复杂任务,让模型在探索与反馈中持续扩展能力边界。Pro与Flash的训练各完成30步,历时不到6天,成本分别约262万与85万美元,累计产生约75万条训练轨迹。
训练任务平均通过率分别相对提升12%和25%;在样本外的长程软件工程基准DeepSWE v1.1上,Pro从58.4分升到72.6分,Flash从48.8分升到65.7分,分数上涨约14分和17分,说明改进没有停留在训练任务本身。

算力扩展沿三条线推进:单次更新使用1568个样本,支持100万Token上下文长度训练,单步训练消耗35亿至37亿Token;构建覆盖编程、通用、视觉、网络安全方向的多任务环境并混合多种执行框架;加大评分模型算力,用组内相对比较给长程任务提供更精细的奖励信号。
规模扩大后,团队冻结MoE路由以抑制专家负载漂移,并搭起覆盖奖励设计、对抗性评测、异常检测和验证器交叉校验的防线,专门应对奖励作弊。
从写代码到造交互世界
MiMo-V2.6把3D空间推理、多模态感知与计算机操作三类能力合在一起。在3D开放世界游戏场景里,模型接收图片、视频或文字输入后,会把需求拆成多个任务,由多智能体协作完成场景搭建、交互逻辑编写和视觉验证,再按渲染结果反复修正。
它还能根据文字描述或参考图在Blender中完成三维建模,产出可用于动画、3D打印和游戏开发的资产;在具身仿真环境中,可直接读取多视角相机画面,闭环控制Franka Panda机械臂完成抓取、颜色匹配和精准放置;在电脑操作场景中,它能理解图形界面、调用常见办公工具并根据视觉反馈排查问题。

科研、审美与开源清单
没有经过科研专项强化学习,Pro已协助研究者筛选用于吸附PFAS(全氟和多氟烷基物质,被称为”永久性污染物”)的金属有机框架材料设计方案;它还在Lean 4中完成了经典论文《周期三蕴含混沌》主定理的完整形式化,形成6000余行通过内核核验的代码。设计榜单Design Arena上,Pro的表现接近Claude Opus 5与GPT-5.6 Sol。
本次开源不止权重:技术报告、7000多个RL任务环境(覆盖软件工程、漏洞复现、知识型工作、网页设计开发)、基于verl与uni-agent等构建的端到端训练框架、可组合的轻量执行框架全部开放,还包括9B蒸馏版——它在11项评测上全面超过SFT基线,例如SWE-bench Verified从61.1分升至66.2分。
价格沿用V2.5体系:Flash每百万Token输入0.14美元、输出0.28美元,Pro输入0.435美元、输出0.87美元,缓存命中价格更低;同智能水平下,官方测算价格仅为海外模型的二十分之一至六十分之一。另有UltraSpeed模式提供最高20倍输出速度,MiMo Desktop桌面端也同步发布正式版。
46.32分不是终点——真正稀缺的是把训练代码、任务环境和权重一起交出来的那份”可复现”。开源与闭源之间剩下的约7分,要靠下一轮算力去填。








