GPT-6能否接管机器人大脑?虎嗅闭门会谈世界模型
世界模型正成为具身智能最热的关键词之一,视频预测、仿真和机器人动作生成都在谈论它。与此同时,GPT-6直接接入机器人做真机测试,引发讨论:语言模型已具备推理、记忆和规划能力,它能否直接接管机器人大脑?
虎嗅AI100闭门会邀请章鱼动力世界模型合伙人陈文科、华映资本海外合伙人邱谆、域变换联合创始人吴昊、墨奇智能世界模型负责人吴桐,从模型研发、资本、自进化和学术前沿四个视角展开讨论。
邱谆提出,把“世界模型”四个字遮住,看项目具体在做什么:能否看懂物理世界、预测动作结果?能否做决策并在真机跑通?第一次失败后下次能否更好?吴昊提炼为三问:能否预测未来,预测能否帮助决策,决策能否在真机闭环。若只能生成漂亮视频却不能帮机器人做下一步决定,距真正大脑还有距离。
陈文科用L、V、T拆解机器人大脑:语言、视觉、触觉。GPT-6再次说明模型Scale到一定程度可能涌现新能力,但不等于Language Scaling可直接换成Action能力。人伸手拿水杯无需先用语言描述,很多物理动作不以语言为最直接中介。L更适合理解、规划和长程任务拆解,直接连接物理世界和动作的是V和T。
吴桐团队对GPT-6真机测试提供另一侧观察:GPT-6指令泛化、In Context Learning和长程任务理解交互更强,但局限明显。实时性上,云端大模型可慢慢推理,机器人需快速反应;视觉反馈不可替代,摄像头被部分遮挡时表现明显下降。她认为现实方向可能是大语言模型承担更高层、更低频的System 2,VLA或World Action Model承担更快、更贴近动作执行的System 1。
从Demo到部署,大脑要自进化。吴桐给出标准:World Action Model要看策略能否在真实环境稳定、安全、高成功率运行;世界仿真器要看是否让后续策略训练更好。吴昊提出,真实世界长尾开放,大脑需在物理交互中持续进化。他打比方:模型今天40分,不必关在实验室等到90分再部署;更理想是进入环境,从成功和失败中学习。陈文科补充,Scaling前提是数据和Infra先做对。
越接近真实世界,越没有悬空的大脑。陈文科直言纯做大脑肯定不行。同种机器人不同批次硬件有差异,执行器有误差,视觉有噪声,接触需高频反馈,这些问题不会因上层模型更聪明而消失。吴桐认为通用大脑可相对独立,但好用的机器人仍需软硬耦合。她举例,团队拿到GPT接口后先在商业机械臂尝试,再把模型部署到自己的本体,模型没见过该本体训练数据,也能完成导航、握手、举起玩偶等动作,说明一些能力可跨本体。但若要让操作自然流畅并进入商业场景,大脑和硬件需进一步适配。
具身智能的AI Coding还没出现。邱谆用OpenAI等基础模型公司的价值逻辑理解机器人大脑的长期可能性,但不知谁会做到、最先在哪个场景做到。他强调投资原则:高认知,低判断。具身智能最重要的商业问题之一也没答案:具身智能的AI Coding场景是什么?大语言模型已找到Coding这样高价值、高频、持续吸收模型能力的场景,具身智能呢?工厂、物流、家庭、康养?邱谆判断现在回答太早。吴昊强调真实环境闭环进化,陈文科强调模型能力本身。一个更接近Deployment first,另一个更接近Scaling first。真正分水岭,也许不是谁先把模型最大,也不是谁先把机器人送进最多场景,而是谁最早把两条线接起来:一边让大脑持续变聪明,一边让真实世界持续给它反馈。