SmoothRL:在线强化学习推动具身机器人实时进化
近日,星尘智能(Astribot)团队发布了在线强化学习框架SmoothRL,并在真实机器人任务上完成验证。该技术并非聚焦于传统意义上的动作生成,而是解决一个长期困扰具身智能发展的核心问题:机器人如何在真实工作过程中边执行、边学习、边改进。\n\n过去几年,机器人基础模型快速发展,视觉语言动作模型(VLA)赋予了机器人理解指令、规划动作和完成复杂任务的能力。然而,从实验环境走向真实世界后,机器人仍面临明显差距。经过大量数据训练的模型往往能完成大致流程,却难以把控接触、定位、力度等细节。例如,机器人能拿起物体却放不准,能打开包装却因几毫米误差而失败。这些问题无法仅靠增加训练数据解决,因为真实环境的随机性极高——物体位置、摩擦力、动作延迟都会影响最终结果。
在线强化学习被认为是应对这一挑战的重要方向。与离线训练不同,在线强化学习允许机器人通过真实交互获取反馈,并根据成败不断调整策略。但机器人领域长期存在一个技术障碍:真实机器人的运行节奏与算法训练节奏并不一致。\n\n机器人执行动作时,控制系统必须保证连续性和稳定性,而强化学习算法通常需要暂停环境、收集数据、更新模型后再继续。这种同步方式在模拟环境中可行,但在真实机器人上容易造成动作延迟甚至失控。此前研究已指出,异步强化学习能降低学习过程对实时控制的影响,使机器人在持续运行状态下完成策略更新。SmoothRL的创新正是在这一矛盾中寻找新平衡。该框架不要求机器人停止工作等待更新,而是基于真实执行过程重新划分动作数据。已完成或确定执行的部分不再修改,真正产生训练价值的是当前实际执行的片段,而尚未执行、可能被新策略替换的部分则被舍弃。\n\n这一设计意味着强化学习不再只关注模型认为机器人应该做什么,而是开始关注机器人实际上做了什么。对具身智能而言,这是重要转变——过去训练多依赖预先采集的数据,未来机器人可能在部署后继续成长,根据自身经历持续调整。
从测试结果看,SmoothRL已展现出巨大潜力。在Astribot S1机器人实验中,动态投掷、给笔戴帽和开箱三个任务均显著提升。动态投掷成功率从39%升至94%,笔帽装配从8%升至83%,开箱从30%提升至90%。实验还显示,在线强化学习不仅提高了任务成功率,还改善了运动稳定性,使执行过程中的加速度和动作变化更加平顺。\n\n此类技术进展反映了机器人发展路径的变化。过去,能力提升主要依赖工程师设计结构、编写规则、采集数据并训练模型。如今,随着基础模型和在线学习技术的涌现,机器人开始具备根据环境反馈主动调整的能力。然而,在线强化学习距大规模应用仍有挑战。首先,真实机器人数据采集成本高昂,一次失败可能带来设备损耗和时间浪费。其次,强化学习需要可靠的奖励机制,若机器人无法准确判断行为优劣,学习效果会受影响。此外,多数在线优化方法仍依赖较强的基础模型;若初始策略距离目标很远,仅凭小规模在线调整很难实现能力跃升。\n\n未来,机器人学习可能不再是一次性训练,而是长期运行中的持续优化。类似SmoothRL的技术探索,正推动机器人从“部署后固定能力”迈向“部署后持续成长”。