宇树开源具身基座模型UnifoLM-WLA-1.0:一个模型统筹64项任务,跨夹爪泛化

AI资讯24小时前发布 EdgeClaw
1 00

人形机器人又多了一个免费的”大脑”。9月10日,宇树科技宣布完全开源新一代通用人形机器人基座模型UnifoLM-WLA-1.0,代码、模型权重、数据集同步开放。这个60亿参数的视觉—语言—动作(VLA)模型,用一套权重同时管起桌面精细操作和全身移动,在真机上跑出64项任务,多项具身推理评测刷新全球开源模型最佳成绩。

一个模型,统筹64项真机任务

过去人形机器人的操作能力往往是”一个任务训一个模型”:叠毛巾的不会开瓶盖,换个夹爪就得重新采数据。UnifoLM-WLA-1.0想解决的就是这种碎片化。真机评测中,单模型实例在宇树G1平台上完成了64项任务,无需针对单个任务额外微调。

人形机器人五指灵巧手在桌面折叠毛巾的精细操作场景

这64项任务分成两大类:54项桌面操作,包括叠毛巾、从传送带上分拣小零件、拧开容器盖、插电源线等高灵巧度的静态作业;10项全身移动操作,需要双足行走、躯干姿态调整和双臂配合,比如倒垃圾、把衣服放进洗衣机、整理鞋子、收拾浴室和厨房、铺床、上架存货。

更关键的是跨末端执行器泛化。模型既能适配基础的平行夹爪,也能驱动两种不同结构的多指灵巧手。以往把两爪夹钳换成五指手,通常会让策略失效、被迫重新采数据;而WLA-1.0通过在不同本体和执行器之间学习共享的隐空间表征,让策略迁移没那么脆弱。

三段式架构:先看懂,再预想,后出手

WLA-1.0不是把机器人控制当成简单的强化学习或模仿学习循环,而是搭了一条结构化的三段式流水线,把视觉理解和动态物理预测串起来。

人形机器人视觉理解世界建模到动作生成的三段式流程图解

最底层是具身推理骨干UnifoLM-ER-1-4B,基于Qwen3-VL-4B,除了常规图文对,还用上了超过500万条具身样本做协同训练,涵盖3D边界框、2D轨迹预测和多图空间问答。在Spatial-Bench、Pixmo-Point、BLINK等空间理解测试中,这个40亿参数的推理模型跑赢了RoboBrain2.0-7B、Pelican-7B、Cosmos-R1-7B等更大的开源基线。

中间层是UnifoLM-ER-Flow,用”以交互为中心”的世界建模做动态区域预测:它估计相邻帧之间的光流,捕捉物理接触引发的场景变化,再用VQ-VAE把动态掩码转成离散Token。给定初始画面和任务指令,模型能预演接下来几步物理场景该如何演变。最上层的动作生成则被划分到统一动作空间里的三条独立流,分别对应末端执行器等不同控制维度。

2500小时真机数据,目标平台是3万美元内的G1

训练数据上,WLA-1.0用了约2500小时真机演示数据,来源包括内部数据集和Hugging Face上的开源社区库BitRobot-HIW-500大规模家庭遥操作数据集。主力落地平台是售价3万美元以内的宇树G1人形机器人。宇树双足机器人产线累计出货已超过1.8万台,软件能力正是把这些机器从实验室推向真实场景的瓶颈。

人形机器人全身协同把衣物放入洗衣机的居家家务场景

这已经是宇树具身智能开源体系的第三代。加上此前开源的VLA-0和WMA-0,宇树搭起了VLA加WMA双技术路线:从”看懂”到”先想后动”,再到”全身协同”。几天前其UnifoLM-X2动态世界模型刚支撑了双足自主对打演示,WLA-1.0则把重点放在抓取、整理、折叠、工具操作这些人形机器人传统上最容易翻车的家务和工业任务上。

开源能否加速”ChatGPT时刻”

这次开源也踩在行业争论的节点上。随着通用大模型在零样本物理规划和工具使用上不断突破,有人怀疑专用具身架构会不会最终被通用推理API吞掉;硬件派则认为算法会快速商品化,真正的护城河在量产平台和开放数据飞轮。宇树选择把权重和训练方法全公开,等于把当年用低成本执行器重构硬件定价的打法,复制到了算法层。

宇树创始人王兴兴此前在世界机器人大会上坦言,物理接触是”有损”的——毫米级偏差会在新环境里不断累积、拉低成功率,人形机器人真正的”ChatGPT时刻”,要等到它能走进陌生房间、靠语音指令完成八成任务,那可能还需两到十年。UnifoLM-WLA-1.0的2500小时多源数据和流解码器能不能可靠啃下”最后一毫米”,现在仍是开放问题;但开源意味着整个研究社区都能一起验证这个答案了。

© 版权声明

相关文章