Figure AI称发现机器人缩放定律,同行反驳56%成功率
Figure AI发布Helix 2.5,创始人Brett Adcock称这是公司成立以来最重要的项目。Figure AI目前估值390亿美元,是全球最贵的未上市人形机器人公司。
过去几代Helix的演示常被诟病在光线良好的样板间进行。Helix 2.5试图跨越这一步:Figure AI在旧金山湾区租下30套住宅,将机器人直接运到现场。
机器人需整理客厅、铺床和折叠毛巾。团队此前未在这些住宅采集机器人数据,也未针对其中的床、枕头、毛巾和玩具进行微调。
三项任务各测试140次。整理客厅需将13至15件玩具全部放入篮子;折叠毛巾需将四条毛巾折好放入篮子;铺床需满足枕头位置、被子方向和床面覆盖要求。需要人工安全干预或超时均记为失败。
铺床成功94次,成功率约67%;折叠毛巾成功87次,约62%;整理玩具成功56次,40%。三项合计成功237次,整体任务成功率56%。相同测试中,未经Index预训练的对照模型成功率仅约9%。
Figure AI用四个不同规模的Index数据集(1倍、2倍、4倍、8倍)训练模型,固定模型大小、下游任务数据和评估方法,仅增加人类行为预训练数据。数据量每翻倍,模型预测机器人下一步动作的误差持续下降。
用前三组实验预测最大规模训练,最终误差仅为整个变化区间的0.54%。Figure AI称之为首条在人形机器人上测得的人类到机器人迁移scaling law。公司已与Nscale签署35亿美元初始算力承诺协议,计划2027年下半年开始部署,长期目标最高达10万块英伟达Vera Rubin GPU。Index以每秒约35分钟的速度收集人类经验。
同行批评:Sunday Robotics联合创始人Tony Zhao(ACT和ALOHA系统核心作者之一)针对56%的可靠性提出质疑。他在Figure AI发布数据后写道,有用的工作等于泛化加可靠性。Figure AI将237次成功理解为机器人能在陌生环境工作,Tony则关注另外183次失败。
在家庭环境中,机器人可能接触易碎物品,也可能与儿童和宠物共同活动。偶尔完成任务与用户能否放心让其独立工作,是两回事。Nikolai Ensslen(Synapticon联合创始人兼前CEO)认为这些数字本身就是模仿学习不能泛化的证据。在他看来,泛化意味着系统换一个地方仍能工作,且每次都能工作。
争议在于,这种迁移是否足以支撑Figure AI对未来的判断。如果56%能随Index扩大稳定提升至80%、90%甚至更高,Helix 2.5将成为机器人预训练路线的起点;如果成功率长期徘徊在一半附近,Tony Zhao和Nikolai Ensslen的批评就不只是不客气的评论,而是对整条模仿学习路线的质疑。