北大、NTU等推出世界动作模型ω-0,重塑人形机器人居家作业模式
家庭,是人形机器人最向往的落地场景,也是技术难度最高的考场。工厂里的机器人面对的是结构化的流水线,每一步操作都可以提前规划;而家庭环境充满变量,桌面可能堆满杂物,地面可能散落玩具,从冰箱取物时需要侧身绕过椅子,擦桌子时需要随着擦拭范围不断调整站位。这些看似寻常的家务,对人形机器人而言却是巨大的挑战。
近日,由南洋理工大学、北京大学、香港科技大学(广州)和智源研究院联合提出了ω-0,一款隐空间预测世界动作模型。输入语言指令后,ω-0可同步识别环境、感知自身状态,直接输出底层控制系统可读取的精简动作特征,支撑机器人完成“边移动边操作”的全身协同任务。研发团队对ω-0模型进行了全方位真机测评,选取了11项高难度居家实操任务,重点考核机器人的动态协同、环境适配与自主决策能力,涵盖了跨区域物品收纳、高低位杂物清理、床上衣物拾取等典型复合场景。实测结果展现出了ω-0模型卓越的性能:ω-0 Ego第一视角任务成功率达79.1%,ω-0 Omni全场景模式成功率高达81.8%,全面超越了π-0.5、EgoVLA、GR00T-N1.7、ψ-0等主流行业基线模型。
ω-0的破局之道在于摒弃了耗时的视频到动作(video-to-action)逆向转换,转而构建统一的查询表征(Query-based Representation)。在这一架构中,未来视觉特征提供了任务进度和场景演变的宏观指引,而动作分支则直接生成可供底层控制器执行的全身动作潜在指令。这种设计降低了延迟,提升了鲁棒性,使机器人能够适应动态的家庭环境。
为了让人形机器人更好地适配真实居家场景的复杂需求,研发团队搭建了三阶段递进式训练体系。第一阶段进行全身动作VLM专属预训练;第二阶段是人机动作隐变量融合预训练,借鉴V-JEPA先进技术思路,融合视觉、语言、机器人本体多维数据,通过视频查询预判未来环境特征,将场景动态变化信息注入动作表征体系;第三阶段为真实场景精细化微调,引入海量真实居家移动操作数据,让机器人能够自主适配各类居家场景。
同时,为了支撑庞大的训练需求,研究团队开源了真实世界家庭人形机器人数据集ω-HOME,包含40.3小时的真实环境数据、4827条任务轨迹、24项任务。每条轨迹均包含同步采集的语言指令、第一视角与第三视角、本体状态、全身运动轨迹等数据,显著降低了下游任务训练对示范数据的依赖。
81.8%的成功率是一个令人振奋的数字,但远不是终点。距离一个能真正融入家庭、长期自主运行的机器人的出现,还有很长的路要走。但ω-0的出现为整个行业指明了一个方向:将机器人的全身视为一个整体来思考,而不是把腿和手当作两个各自为政的部门。当机器人学会在移动中操作、在操作中调整姿态,才真正有了从“实验室演示”走向“生活化服务”的可能。