GPT-6 Astra控制亮眼,真机安全待解
GPT-6 Astra发布次日,Robocurve将其接入机器人执行任务,发现其控制表现突出且Token消耗低。在一项机器人控制任务中,Astra成功率达95%,高于Fable 5.1的40%;输出Token用量约为后者1/6.2,成本约1/2.3。
这带动了基模控制机器人完成复杂操作的案例涌现。有知名具身智能企业创始人表示,今天的具身智能还没有真正护城河,通用模型公司在人才、算力和资金上占优,未来一两年是关键窗口。
但亮眼成绩不等于真机安全。RoboDojo团队在官方评测中指出,Astra在真机测试中反复发出物理上不合理或不安全的动作,部分事故甚至造成硬件损坏。出于安全考虑,团队提前停止测试,Astra未能完成原定18项任务的RoboDojo-Real评测。
这提醒,基模能力突破只是起点。约束动作、处理失败,让机器人安全稳定持续工作,仍是系统层面必须解决的问题。
穹彻智能发布RoboRSI,一个面向真实复杂场景的机器人多智能体自进化框架。它试图回答:当基础模型具备强大理解和推理能力后,如何在系统层面构建持续执行、诊断、修订和复用的完整闭环。
RoboRSI把规划、执行、诊断和修订拆分到不同上下文,采用Manager、Planner、Engineer、Reviewer四类智能体协作架构。四者围绕同一任务和同一份执行证据接力运行,形成执行、诊断、修订、再执行的闭环,人类仍保留对目标、价值判断和安全边界的控制权。
穹彻智能提出TSR机制,用四层技能树组织机器人全部能力。每次修改被限制在清晰技能边界内,Agent可专注局部实现和修订,而不会因连续调试偏离全局目标。历史经验由此从对话记录和日志,变成下一轮真正可调用的能力。
其还设计三阶段演进机制:从成功调用链中提取稳定结构,把物体类别、目标区域和空间关系参数化,再将可复用流程固化为代码技能。类似任务再现时,Agent只需选择、监控并在必要时修订整条技能。在LIBERO基准测试中,启用代码固化相比未启用版本,回合通过率从21.5%提升到29.0%,中位Token消耗下降29.4%。
适配成本同样变化。在RoboRSI框架下,同等能力构建可在一天内走完完整闭环。2024年完成类似家庭地面清理Demo,需要两名工程师连续投入约一个月,编写约2000至3000行任务代码。若系统能自主完成任务拆解、技能实现、执行诊断和代码修订,适配新场景的核心成本就从工程师驻场数周,变成设定目标、系统自主迭代加人工审核和安全把关。
这为家庭等高度个性化场景打开新商业空间。每个家庭户型、家具布局和物品摆放都不同,若每次部署都需工程师驻场数周,服务成本很难支撑大规模推广。缩短适配周期,意味着过去因定制成本过高而难以覆盖的分散场景,都有机会成为可服务市场。