宇树G1进手术室:人形机器人的第一次活体手术做到了什么程度
为什么读:第一次把「人形机器人能不能做手术」变成一组可以互相比较的数字。
文|Embodied AI Frontier
2026年7月8日,加州大学圣地亚哥分校的工程与外科团队在《自然》发表论文,报告两台遥操作人形机器人在活体猪身上完成了腹腔镜胆囊切除。平台是市售的宇树G1,研究里昵称Surgie,高5英尺、重60磅,对照的专用手术系统约重1800磅。论文同时给出了刻度:直线轨迹偏差约1.3毫米,圆周轨迹偏差约10.4毫米,跟随延迟156毫秒。两项干实验室任务里,它已经强于徒手操作,却明显落后于达芬奇Xi。这篇拆开这份「第一次」的成绩单,并指出离临床还差四道关。
本文结构
- 一、手术档案:两例活体猪胆囊切除的完整记录
- 二、为什么是一台通用人形机器人:体积、臂展与成本
- 三、精度刻度:直线、曲线与156毫秒延迟
- 四、临床前的四道关:无菌、穿刺器布局、校准中断与远程操作
- 五、结论:这次「第一次」证明了什么,还差什么
一、手术档案:两例活体猪胆囊切除的完整记录
2026年7月8日,加州大学圣地亚哥分校(University of California San Diego,简称UCSD)发布消息,该校工程团队与外科团队用两台遥操作人形机器人在活体动物身上完成了两台手术,论文同日发表在《自然》(Nature)第657卷,页码236至2442In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。官方稿把这称为活体外科手术的世界首例1Surgeons Use Teleoperated Humanoid Robots to Perform Live Surgery – a World First点击查看文末条目 →。
论文里的表述更收敛:这是人形机器人手术系统首次在猪模型上完成标准的腹腔镜胆囊切除3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。胆囊切除是外科最常见的操作之一,在腹部开几个小孔,把胆囊从肝床上剥离下来。
两例手术的编排不同。第一例由一台人形机器人和一名人类外科医生配合,医生担任助手;第二例由两台人形机器人并排完成1Surgeons Use Teleoperated Humanoid Robots to Perform Live Surgery – a World First点击查看文末条目 →。手术对象是大型非灵长类哺乳动物,两例都没有中途转为传统腹腔镜或开腹手术1Surgeons Use Teleoperated Humanoid Robots to Perform Live Surgery – a World First点击查看文末条目 →3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。
机器人本身并非为手术设计。论文写明实验平台是宇树G1(Unitree G1),称其为「一台经济的、可商购的通用人形机器人」3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。宇树科技(Unitree)是中国杭州的人形机器人公司,主要靠公开销售整机和开发者套件做生意;在这项研究里,它的角色是提供市售平台,手术由UCSD团队完成,官方稿与论文在这一点上口径一致1Surgeons Use Teleoperated Humanoid Robots to Perform Live Surgery – a World First点击查看文末条目 →3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。
机器人在研究里被昵称为Surgie。这个名字出自同一团队2025年的前作,那项工作只验证了受控条件下的灵巧操作,没有做手术3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →4《In vivo feasibility study of humanoid robots in surgery》论文存档页点击查看文末条目 →。
两例的过程留下了量化记录。主动控制台时间,也就是外科医生实际操控机器人的时长,从第一例的56分15秒缩短到第二例的31分59秒3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。两例之间的差异无法归因于单一变量;官方稿的表述是这类开销在早期专用系统上同样存在、预计会随时间改善1Surgeons Use Teleoperated Humanoid Robots to Perform Live Surgery – a World First点击查看文末条目 →,样本只有两例,还不足以画出一条学习曲线。
真正有信息量的是中断。论文里的「重新部署」,指围绕穿刺器位置对机器人做整体重新校准或物理移动,第一例发生8次、第二例4次;器械交换是并列的另一类事件。这两类操作各自最少要花3分钟,论文把它们统一计入单次超过3分钟的「重大暂停」,两例分别是2次和3次,不到1分钟的小暂停则从7次降到4次3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。论文对这两组数的表述是双面的:中断确实打断了手术流程,控制台实际操控期间的性能没有受影响,两例的关键操作都完成得「出色」3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。
两例并非零风险。第二例出现了少量胆汁溢出与肝床出血,用吸引和电凝处理,没有转为开腹3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。
二、为什么是一台通用人形机器人:体积、臂展与成本
一台手术机器人进手术室的第一个障碍,往往来自房间本身。UCSD官方稿给出的对照是:专用手术系统通常配三到四条机械臂、专用器械和专有软件,整机重约1800磅,需要一整个团队搬运就位,还会占掉手术室里很大一块面积,房间通常要为此改造1Surgeons Use Teleoperated Humanoid Robots to Perform Live Surgery – a World First点击查看文末条目 →。
参与这项研究的机器人是另一套量级,高5英尺,重60磅,按重量算,专用系统是它的30倍1Surgeons Use Teleoperated Humanoid Robots to Perform Live Surgery – a World First点击查看文末条目 →。
论文还给了更小的刻度。G1的臂展约450毫米,论文把成年人的臂展1.6米到1.8米放在同一处做参照3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。按这组对照推算,它的臂展约为成年人的四分之一。范围直接决定它能不能站到手术台边:腹腔镜手术的器械要穿过固定位置的穿刺器,手臂够不够得到、会不会相互遮挡,都是硬条件。
成本一侧,能核的只有定性口径与媒体量级。官方稿说这类平台的花费是专用系统的「一小部分」,没有给数字,论文也没有披露价格1Surgeons Use Teleoperated Humanoid Robots to Perform Live Surgery – a World First点击查看文末条目 →3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。福布斯的报道给出了两个量级:这类通用人形机器人的售价低于2万美元,而在用的专用手术系统价格在数百万美元级别5Humanoid Robots Just Performed Live Surgery For The First Time Ever点击查看文末条目 →。这两个数字来自媒体,出自厂商或研究团队的正式数据仍是空白,只能当作量级参考。
外部媒体对这台机器的定位指向同一件事。福布斯7月10日的报道把它描述为「货架上的」宇树G1,强调它的通用性与可获得性5Humanoid Robots Just Performed Live Surgery For The First Time Ever点击查看文末条目 →;南华早报的报道角度是「美国科学家用中国机器人做手术」6US scientists use Chinese humanoid robot to carry out keyhole surgery and remove organs点击查看文末条目 →。同一台机器,在英文报道里是成本结构的变量,在中文报道里首先是中国供应链的位置。这台机器能进入手术室的前提,正是具身智能行业默认的那条假设:一套通用本体,去适配多种任务。
三、精度刻度:直线、曲线与156毫秒延迟
论文把「能不能做手术」拆成了可测的量。第一块是台架上的轨迹精度:让器械尖端沿预定的几何轨迹运动,用光学动作捕捉系统记录实际轨迹,再算偏差。直线运动的偏差约1.3毫米,圆周运动的径向偏差约10.4毫米,两者差了约八倍3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。论文对这组数的判断是:直线跟踪已经做到毫米级,曲线运动仍受面内精度限制3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。
对照的刻度来自文献。论文在同一段里引用已有研究,指出临床在用的遥操作手术机器人,在校准条件下的定位精度约为1毫米3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。这个数字不来自同一场实验,论文列出它是为了说明同一件事:曲线轨迹是这块平台当前的短板。
第二块是延迟。操作者手部动作与机器人末端动作之间的跟随延迟约为156毫秒,由每秒120帧的高速相机测得3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。论文引用文献的说法是,常规手术机器人系统通常希望把延迟控制在150毫秒以下3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。156毫秒与这条线相差6毫秒,看似不远,但远程手术的延迟会随距离增长,论文与官方稿都把这一点列在待改进清单上1Surgeons Use Teleoperated Humanoid Robots to Perform Live Surgery – a World First点击查看文末条目 →3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。
第三块由使用者来打分。两项干实验室任务招募的受试者不同:一项是18人的O形环传递任务,其中6名外科医师、12名未受过医学训练的新手;另一项是13名受过专业医学训练的外科医师参加的腹腔镜基本功训练任务3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。
每位受试者按随机顺序在三种条件下各操作一遍,人形平台、专用手术系统与纯手工,随机是为了压掉疲劳带来的顺序偏差3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。把三组结果并排看,位置就很清楚了。
表1(Table 1)两种干实验室任务里三种操作条件的表现
| 任务与指标 | 人形平台 | 专用手术系统 | 纯手工 |
|---|---|---|---|
| 基本功训练任务:得分(满分100) | 85.4 | 97.7 | 70.5 |
| 基本功训练任务:完成时间 | 560 秒 | 118 秒 | 878 秒 |
| O形环传递任务:加权误差(越小越好) | 4.5 | 4.6 | 7.0 |
| O形环传递任务:完成时间 | 75 秒 | 43 秒 | 64 秒 |
来源:Nature 第657卷,236至244页(2026),表1与表2;专用手术系统在训练任务中是达芬奇Xi,在O形环任务中是达芬奇研究套件。
这张表给出的是同一个判断:人形平台强于徒手,弱于专用系统。它在训练任务上的得分比徒手高约15分,比达芬奇Xi低约12分;用时和失误都约为达芬奇Xi的5倍。O形环任务是另一幅画面,它的加权误差与专用系统基本持平,用时却最长,新手组最明显3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。
把受试者按经验分开看,结论没有变,只是差距会收窄。同样是人形平台,资深外科医师的得分已经接近94分,与达芬奇Xi的98.7分只差5分,而初级医师只有79分出头3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。同一台机器,换成熟练的手来操作,成绩明显更好。
官方稿里另有一句需要单独看。操刀的加州大学圣地亚哥分校医学院外科助理教授 Shanglei Liu 在手术后说,由遥操作人形机器人完成的手术,精确度与遥操作手术机器人系统相同1Surgeons Use Teleoperated Humanoid Robots to Perform Live Surgery – a World First点击查看文末条目 →。这句话的语境是术中操作与临床现场,前一张表上的数字来自干实验室里的重复测量,两者是两类证据。它们可以同时成立:在手术台上,两种平台都完成了关键动作;在可控条件下的重复测量里,人形平台落后得更明显。
四、临床前的四道关:无菌、穿刺器布局、校准中断与远程操作
论文自己列了临床化的前置条件,共四类。
第一是无菌。研究期间靠给机械臂套上无菌手套维持无菌,这套做法无法完整复现人体手术的无菌流程;市面上的商用机械臂没有能承受高温高压灭菌的部件,论文把「既要保证无菌,又不能损伤传感器功能与运动校准」列为关键障碍3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。
第二是工作空间。腹腔镜手术要求器械穿过穿刺器,并围绕穿刺点保持一个固定的支点,这是专用系统与手工手术共同的基本约束。论文的测评结论是,在标准穿刺器布局下,人形平台只在部分支点位置上达到可比的工作空间,标准布局需要为人形平台重新适配,之后才能进入手术部署3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。
第三是校准中断。动物呼吸与机器人底座漂移会让实际支点位置不断变化,团队用时间滤波避免不安全扰动;一旦漂移过大、视野变差或器械行为异常,手术就停下来重新校准,一次至少3分钟3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。这条对应的是第一节里的8次与4次:中断属于当前平台的常规开销。
第四是远程化。延迟、可达范围、力反馈都在待改进清单上,论文与官方稿都把「在偏远地区或现场医疗场景部署」列为长期目标1Surgeons Use Teleoperated Humanoid Robots to Perform Live Surgery – a World First点击查看文末条目 →3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。
还有一条不属于技术清单,但需要写明。这项研究的对象是猪,属临床前动物实验,论文自述的目的是验证可行性并量化当前能力与限制,距离在人体上使用还隔着法规、伦理与更多轮验证3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。
五、结论:这次「第一次」证明了什么,还差什么
回到最初的问题:一台市售人形机器人做完两台手术,说明了什么。
它说明可行性,并把可行性变成了可以比较的数字。在此之前,「人形机器人能不能做手术」更多停留在任务演示层面;这份研究给出了连续的刻度:单例控制台时间、重新部署次数、台架轨迹精度、跟随延迟,以及两项任务里与人和专用系统的对照3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。
它的成绩单是分层的。在路径简单、一次成型的动作上,包括直线跟踪、器械传递、胆囊管夹闭与胆囊游离,它已经能与专用系统和人类外科医生对话;在需要连续曲线与稳定支点的动作上,它落后于专用系统一个明显的距离3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。这个距离的参照物值得重复一次:论文引用的临床在用系统定位精度约为1毫米,它的圆周轨迹偏差超过10毫米;训练任务上的失误计数,达芬奇Xi 不到它的四分之一,纯手工则比它高出一大截3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。
本站此前在《中国真的把人形机器人用进工厂了吗?》里处理过同一类问题:一项技术「进去了」和「被验收了」之间,通常隔着可量化的一层。这次手术的量化层已经由论文给出。
往后看,有三个方向值得盯。
一是后续活体研究里的两项开销。控制台时间从第一例的56分15秒降到第二例的31分59秒,重新部署从8次降到4次,样本只有两例,还看不出稳定趋势;如果第三例、第四例继续下降,说明这套框架在补短板,如果停在原地,说明平台的瓶颈在硬件而非操作者3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。
二是曲线精度与延迟能否靠近专用系统的水平。圆周轨迹超过10毫米的偏差与156毫秒延迟是两个最硬的数字,也是决定它能否从「完成得了」走到「靠得住」的地方3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。
三是无菌方案与器械适配。给机械臂套手套当前是权宜之计,穿刺器布局需要重新设计;这两件事都落在工程侧,一旦有可灭菌部件与专用穿刺方案的公开验证,人形平台才真正具备进入手术室的资质3In vivo feasibility study of humanoid robots in surgery点击查看文末条目 →。
论文的数据与代码已在Zenodo公开,其中干实验室研究的数据集与本文的分析代码分别存档,可供独立复核7《User Performance Data Sheets》干实验室用户表现数据表点击查看文末条目 →。这次「第一次」的分量,正在于它把「人形机器人进手术室」从演示推进到了一份可被同行评审、也可被复现的基线。对具身智能这条线来说,手术室是继工厂与仓储之后,又一个开始被量化的场景。
(全文完)
附:来源与数据说明
本文为考证文,正文事实与数据均来自以下公开可核验信源。
研究本身
媒体与数据