世界模型离通用还有多远?生数科技给出五级路线图
(TechPulse 报道)通用世界模型的形态在AI圈尚无定论:视频生成公司视其为模拟器,机器人公司视其为决策大脑,自动驾驶玩家也纷纷押注。在8月19日世界机器人大会的一场分论坛上,生数科技创始人兼首席科学家朱军给出了自己的答案:他将通用世界模型划分为五个层级,生数科技的研发与落地已覆盖至第三级。
朱军从第一性原理出发,以人学骑车、开车为例,说明大脑在与外部世界互动中逐渐建立内部模型。他认为,通用世界模型需具备三项相互关联的能力:理解世界(看懂环境、判断状态)、预测未来(预判后续发展及不同动作的结果)、采取行动(影响环境并用真实反馈修正理解与预测)。他强调,这不是单一生成器、模拟器或策略模型的简单串联,而是闭环反馈系统。
数据方面,他提出多层金字塔:底层是海量网络视频,向上依次是领域视频、第一视角人类视频和带动作记录的人类示范,塔尖是真实机器人交互数据,越往上越稀缺、成本越高。架构上,生数科技采用MoT(Mixture-of-Transformers),不同模态各有专属参数,通过共享注意力实现跨模态交互,使环境理解、状态预测和动作生成在同一模型中运行。基于此,世界动作模型Motubrain实现了理解、预测与行动的集成。
朱军给出五级路线图:L1世界生成,模型学会生成连贯世界演化视频;L2与世界交互,模型可接收实时输入并持续互动;L3在世界中行动,模型进入物理世界,统一环境理解、预测和动作生成,输出可执行动作;L4自主世界智能体,围绕长期目标主动感知、拆解任务、探索新状态;L5世界组织者,调度机器人、数字智能体、人和工具,实现多智能体协作。生数科技目前实践聚焦于前三层。
生数科技数据显示,Motubrain推理速度比Motus快约10倍,换机器人本体仅需50-100条人类示范即可适配,在RoboTwin 2.0基准测试中以96.1分居首,已在银河通用、星尘智能、千寻智能等近十种本体上验证通过。但距高阶智能仍远,视频模型生成质量、时空一致性有待提升,世界动作模型在复杂开放环境中的稳定性、泛化能力、执行效率也需优化。
对于L4与L5,朱军指出六项关键挑战:建立联合评测体系、学习真实物理规律(接触、摩擦、作用力等)、形成持久可修订记忆、通过真实交互实现在线学习与自我进化、满足现实延迟与资源约束的高效闭环部署、以及安全性与可控性。他认为,当理解、预测与行动真正形成闭环,世界模型将成为连接数字与物理世界、迈向通用具身智能的重要基础。