后训练不用真机数据也学会了做实验,灵巧操作的数据账正在重算
为什么读:机器人训练数据的门槛,从「有没有」移到了「能不能证明」。
文|Embodied AI Frontier
2026 年 9 月 2 日,自变量机器人发布 TwinDEX,用一套可穿戴外骨骼采集的数百条示范,让机器人在化学实验场景中一镜到底完成 24 个子动作,后训练阶段没有使用真机遥操作数据1TwinDEX 项目页点击查看文末条目 →2TwinDEX Introduces a Scalable Path from Robot-Free Data Collection to Real-World Dexterous Manipulation点击查看文末条目 →。这件事的分量不止于单次演示,它把具身智能沿用十年的默认设定摆上了台面:金字塔塔尖的数据为什么最有价值。本文按三类数据来源拆开 2026 年「无本体数据」的真实规模结构,核对成本与有效性两套口径,并指出这一轮被削平的是真机数据的稀缺溢价,而非它的类别地位。门槛已经从「有没有、够不够」移到「能不能用、是否好用」。
本文结构
- 一、引子:一次没有真机遥操作数据的演示
- 二、需求侧:工序复杂度正在上移
- 三、真机数据为何位于塔尖
- 四、2026 年的两条路线:把本体前移
- 五、一家公司五个月里的口径演进
- 六、尚未改变的部分
- 七、结论:未来两至三年的观察点
一、引子:一次没有真机遥操作数据的演示
2026 年 9 月 2 日,深圳的自变量机器人(X Square Robot)发布了一套叫 TwinDEX 的系统。它由一对孪生设备组成:一只可穿戴的三指外骨骼用于采集示范,一只结构与之匹配的机器人末端用于真机部署,两者共享同一套运动链、关节轴与连杆比例1TwinDEX 项目页点击查看文末条目 →2TwinDEX Introduces a Scalable Path from Robot-Free Data Collection to Real-World Dexterous Manipulation点击查看文末条目 →。
配套放出的演示是一段化学实验:开瓶取样、滴管吸液、玻璃棒引流、摇匀观察,全程由策略自主执行,含 24 个子动作,跨越三种工具,多次双手协调与工具切换3自变量发布 TwinDEX点击查看文末条目 →1TwinDEX 项目页点击查看文末条目 →。据公司称,驱动这段演示的策略只用数百条可穿戴设备采集的示范完成训练,后训练阶段没有引入任何真机遥操作数据;同一批材料给出的采集吞吐约为真机遥操作的 5.3 倍1TwinDEX 项目页点击查看文末条目 →2TwinDEX Introduces a Scalable Path from Robot-Free Data Collection to Real-World Dexterous Manipulation点击查看文末条目 →。
需要立刻把限定条件放在前面。这是一段单条 103 秒的录制,没有时间码、没有第三方机位、没有控制信号说明,因此「全程自主」既无法从该文件证实、也无法从该文件推翻1TwinDEX 项目页点击查看文末条目 →。演示所在的场景是单个桌面工作空间、有限的物体类别,公司自己在项目页写明了这一点,也写明了长时间穿戴采集的人机工效「尚未系统研究」1TwinDEX 项目页点击查看文末条目 →。截至 2026 年 10 月 3 日,TwinDEX 的硬件资料、数据与技术报告均未公开:项目页的 BibTeX 仍是「Coming soon」,论文链接指回本页,GitHub 组织的仓库列表里没有它,arXiv 检索命中为零1TwinDEX 项目页点击查看文末条目 →8[8] GitHub / arXiv / Hugging Face 接口实测(2026-10-03)点击查看文末条目 →。
把这些限定全部摆开之后,这件事仍然值得读,原因不止于这家公司。同样的问题在 2026 年被多个玩家同时撞上:Google DeepMind 在 8 月发布 Gemini Robotics 2 时把全身控制与灵巧双手放在同一段叙事里;1X 在 1 月披露其世界模型用了 900 小时人类第一视角视频与 70 小时真机数据19公司技术博客点击查看文末条目 →;NVIDIA 与加州大学伯克利分校、马里兰大学团队在 2 月放出 EgoScale,用超过 20,854 小时带动作标注的第一视角视频,报告了一条人类数据规模与下游真机表现之间的对数线性关系14EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data点击查看文末条目 →。7 月,一篇 29 位作者的综述把整个具身数据生态排成了一张「数据金字塔」10Data Pyramid for Embodied Manipulation: A Survey点击查看文末条目 →。
一台机器人学会了做实验,本身不是新闻。教它做实验的那几百条示范里没有一条来自机器人,这才是这一轮真正要算的账。
二、需求侧:工序复杂度正在上移
2.1 尚未被替代的工序
讨论数据之前,先把「活」摆出来。机器人本体在过去两年已经越过了运动这道关,跑、跳、翻、爬在 2026 年是一批厂商的既有能力。真正拉开差距的,是那些要求毫米级定位与稳定力控的工序:柔性装配、线缆连接、拆包分拣、质量检测、实验室操作、护理与康复辅助。
这些活有一个共同点:它们对「像不像人手」不敏感,对「能不能每次都干对」极其敏感。装配线上一个插接动作,失败一次就是停线;实验里一次滴管挤压力度失控,样品就报废。工序本身不看机器人有几根手指,它看节拍、看一次通过率、看连续运行三个月之后还稳不稳。
2.2 当前承担方
按动作精度与物体不确定性两个维度分档,可以看到一条清晰的替代顺序:
| 档位 | 典型工序 | 当前由谁承担 | 为什么还没有换 |
|---|---|---|---|
| 低不确定、低精度 | 搬运、码垛、上下料 | 二指夹爪与专用自动化设备 | 已经换过一轮,成本最优 |
| 低不确定、高精度 | 定点点胶、螺丝锁附、检测 | 专用设备为主,夹爪补充 | 节拍与重复精度已被专用设备做到极致 |
| 高不确定、低精度 | 拆包、分拣、清理 | 人工为主,夹爪试点 | 物体形态变化大,夹爪泛化不足 |
| 高不确定、高精度 | 线缆连接、柔性装配、实验室操作 | 人工 | 需要接触后的持续力控与双手协调 |
表 1(Table 1)具身操作工序的替代顺序与当前承担方
四档里,前两档是自动化设备的地盘,后两档是人的地盘。2026 年所有关于「灵巧操作」的讨论,实质都在问同一件事:第三、第四档能不能开始挪。
2.3 替代需要跨过的五道门槛
买方评估一只机械手或一套操作策略时,真正要看的是五条,自由度数量并不在其中:可靠性(能不能连续干三个月)、寿命(多久需要维护或更换)、可维护性(坏了多久能修好)、集成成本(接进现有产线要多少改造)、节拍(能不能跟上线速)。
这五条与价格无关,也与训练数据的价格无关。中国厂商已经把手的价格从单只 5 万元压到 6000 至 8000 元区间,但据 MIR Databank 口径测算,2025 年真正用在整车与零部件产线上的灵巧手仍不足总需求的 1%(相关论证见本站此前对灵巧手价格与工厂采纳的分析)。价格没有唤醒需求,需求只被能力说服。
所以问题往下走一层:能力是怎么被训练出来的。
三、真机数据为何位于塔尖
3.1 沿用十年的默认设定
2025 年 3 月,NVIDIA 在介绍其 Isaac GR00T N1 模型的官方文章中写下一句话:金字塔的塔尖是通过遥操作采集的真机数据17Accelerate Generalist Humanoid Robot Development with NVIDIA Isaac GR00T N1点击查看文末条目 →。这句话在此后一年半里被反复引用,成了行业讨论数据价值的默认坐标系。
理由并不玄。真机遥操作录下的动作,是在目标机器人本身上执行的:关节角、末端位姿、夹爪状态、力反馈,全部带有明确的可执行语义,采集完可以直接进训练。相比之下,人类视频记录的是人的手,手持夹爪记录的是另一套末端执行器,仿真记录的是被近似过的物理。只有真机数据的动作,能在产生它的那台机器上直接执行。
这一默认设定并非没有异议。2026 年,Sergey Levine 在公开撰文中写道,若要真正建立机器人基础模型,真实数据是不可替代的,代理数据只能作为补充22[22] Sergey Levine点击查看文末条目 →。
3.2 数据金字塔的五层与两条轴
2026 年 7 月,一篇题为《Data Pyramid for Embodied Manipulation》的综述把这张图谱完整展开10Data Pyramid for Embodied Manipulation: A Survey点击查看文末条目 →。它用两条轴组织整个具身数据生态:一条是可扩展性(相对于硬件依赖、人力、环境重置与边际成本,数据能被扩大的效率),另一条是与机器人的对齐度(观测、表示与监督信号能多直接地支持在物理机器人上学习与执行)。两条轴天然对立。
按这两条轴,论文把数据分成五层,从塔尖到塔基依次是:真机数据、UMI 式手持夹爪数据、自我中心与第三人称人类数据、仿真数据、通用数据10Data Pyramid for Embodied Manipulation: A Survey点击查看文末条目 →。论文对塔尖的表述是:真机数据位于顶端,因为其记录的动作可以直接在产生它的平台上执行,而这份保真度的代价是硬件、人力与重置10Data Pyramid for Embodied Manipulation: A Survey点击查看文末条目 →。

图 1 具身数据金字塔的五层与两条轴
来源:Data Pyramid for Embodied Manipulation: A Survey(arXiv 2607.24744,2026-07-27)、NVIDIA Isaac GR00T N1 官方博客(2025-03)
同一篇论文对 UMI 层的定位同样明确:它更适合被看作对本体专用真机数据的可扩展补充,而非完整替代;并且论文写道,最优配比仍未解决,因为各数据源的贡献尚未被系统地分离,而纯机器人模型依然能取得强劲表现10Data Pyramid for Embodied Manipulation: A Survey点击查看文末条目 →。
3.3 该排序被普遍接受的原因
这套排序被接受,还有一个工程上的理由:替代方案曾经都不够好。手持夹爪依赖腕部视觉 SLAM 做位姿估计,视角被手或物体遮挡时轨迹会漂移;双手之间的相对位姿靠跨相机共视重建,协调任务的误差大;相机、夹爪编码器与位置传感器来自不同设备,靠软件或无线对齐,接触瞬间的毫秒级错位会直接影响策略学习11HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone点击查看文末条目 →。人类第一视角视频提供规模与真实性,却只有图像,没有可执行的动作与触觉信号。
于是行业的默认做法成形:无本体数据用于大规模预训练,进入具体任务与后训练阶段,再补一小段真机数据做对齐。2026 年 9 月 24 日,新华财经在行业调查中仍然记录着这一判断:无本体数据与真机遥操作数据更可能形成分工协作,覆盖广、成本较低的无本体数据用于大规模预训练,进入具体任务、具体工厂和后训练阶段后,还需真机遥操作数据校准23从"遥操作"到"无本体" 具身智能数据迎有效性大考点击查看文末条目 →。
四、2026 年的两条路线:把本体前移
4.1 路线一:提高采集端保真度
中国的深朴智能(Simple AI)在 2026 年 7 月发布 HiFi-UMI,做法是围绕四个维度重建采集硬件与数据处理:轨迹精度、双手位姿、时间同步、视野覆盖11HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone点击查看文末条目 →。
具体而言,它把视觉定位的基准从手腕移到头部,用头戴式双目相机与惯性测量单元离线重建头部轨迹;双手夹爪的相对位姿由硬件原生测量,不再依赖跨相机共视的事后重建;每只手另装两台非平行广角鱼眼相机,覆盖约 200 度视场。时间层面,它用统一 GPIO 硬件触发器替代软件对齐,六路相机、IMU 与夹爪编码器由同一路信号驱动,跨传感器同步误差压到 40 微秒以内11HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone点击查看文末条目 →。
论文报告的结果是:工作空间内末端轨迹误差约 3 毫米,后训练阶段仅使用其示范,策略即可部署到真机;在 VLA 与 WAM 两类架构的代表模型中,整体成功率达到同域真机遥操作数据的相近水平。其中在 WAM 模型 LingBot-VA 上,两条路线的成功率分别为 56.9% 与 57.5%11HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone点击查看文末条目 →。该团队同时开源了 2,000 小时的数据集12HiFi-UMI-2K 数据集点击查看文末条目 →。
论文也写下了自己的边界:他们证明了高保真足够,但没有回答每种属性需要多少,也没有通过受控退化实验把各项因素分离出来11HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone点击查看文末条目 →。
4.2 路线二:采集端与执行端结构一致
TwinDEX 走的是另一条路径:把机器人真正需要的动作结构提前复制到采集端。采数外骨骼与执行末端为共设计(co-designed),两者保持结构同构,并在相同位置集成同款触觉传感器,接触动力学与触觉感知层面严格一致,手指状态因此可以直接映射进机器人关节空间,绕过人手到机器人的重定向计算1TwinDEX 项目页点击查看文末条目 →2TwinDEX Introduces a Scalable Path from Robot-Free Data Collection to Real-World Dexterous Manipulation点击查看文末条目 →。
据公司称,这套设计是在覆盖多种元操作的基准上比较不同构型后定下的:三指九自由度(7 个主动加 2 个被动)在灵巧性、机械复杂度、穿戴舒适度与硬件成本之间取得平衡,被判定为当前任务集下的最小可行解1TwinDEX 项目页点击查看文末条目 →2TwinDEX Introduces a Scalable Path from Robot-Free Data Collection to Real-World Dexterous Manipulation点击查看文末条目 →。公司同时说明了这一选择的代价:更高灵巧度的任务,例如多指精密装配,可能需要探索更多自由度的构型1TwinDEX 项目页点击查看文末条目 →。