CROSSBFM:一小时蒸馏多机器人行为空间
科技行者10月9日报道的论文提出CROSSBFM。行为基础模型能用同一潜变量向量表示“模仿动作”“走到姿势”“最大化奖励”等目标。
但训练一台机器人就消耗上百个GPU小时。换一台机器人重新训练出的第二套潜空间与第一套毫无关系,同一坐标点对应动作完全不同。
论文在两套坐标系统间架桥:冻结源机器人行为基础模型的潜空间,用统一编码器把重定向数据当作跨机器人对应关系,一小时内完成多机器人行为空间蒸馏,无需把整本书重新盲文化。
文章从潜空间为何不能直接迁移、统一编码器如何设计、策略训练与奖励优化如何跨机器人实现、泛化边界等角度展开。
重定向数据来自不同本体间的动作映射,成为对齐两个潜空间的正样本;编码器学习保留任务相关结构、过滤本体噪声。对齐后,源空间策略可在新机器人上少量微调部署。
实验显示一小时蒸馏,但依赖重定向对应质量,形态差异过大仍可能退化,奖励优化也需适配。通过复用冻结源空间,它减少每个新机器人从头训练的需求,指向更可扩展的行为基础模型。
✓ 已核对
2026-10-09