对话 IROS 最佳论文奖入围团队:灵巧手的「反内卷」,先让手掌动起来

一只机器人手要拧开防儿童瓶盖,最直接的思路,是让它越来越像人手 。

更多手指、更多关节、更多自由度,再训练一套足够复杂的控制策略。

普渡大学的 周于皓 和合作者却给出了另一个答案:

先别急着继续加手指,让手掌也动起来。

在 IROS 2026 现场, 周于皓 展示了团队的 VTAP Gripper。这项入选最佳论文奖的工作,只采用了三根手指,但原本经常只是被动支撑面的 palm,被做成了一个既可以主动运动、又具备视觉和触觉感知能力的接触面。

论文由 周于皓 、Sheeraz Athar、胡智娴、黄秉豪、李昀烛、Juan Wachs 和 佘宇 共同完成。其中, 周于皓 、Sheeraz Athar、 胡智娴 、Juan Wachs 和 佘宇 来自普渡大学, 黄秉豪 和 李昀烛来自哥伦比亚大学;佘宇为通讯作者 。

论文一 作 周于皓 是普渡大学工业工程博士四年级,他 所在的 MARS Lab 由 佘宇 主持,研究方向是把机构设计、触觉传感和强化学习结合起来。据普渡大学工业工程学院的消息,MARS Lab 与合作者共有 10 篇研究成果被本届 IROS 接收。

在接受 42 号电波采访时 , 周于皓 说,自己对这篇论文能入围有些意外。论文试图探索一种不同于高度仿人灵巧手的 设计空间:能否通过 finger-palm synergy 和多模态感知,用更简单的机械结构获得足够丰富的 manipulation ability。

机器人究竟需要多少复杂度,才足够灵巧?这是 VTAP 想回答的问题。

自由度应该加在哪里?

今天的机器人末端执行器,大致可以看到两个极端。

一边是工业场景常见的一自由度 parallel gripper:结构简单、稳定、容易控制,但通常只能完成相对基础的抓取和放置。

另一边则是越来越拟人的灵巧手。五指、十几个甚至二十多个自由度,让它们拥有更接近人手的运动空间,但机械和控制复杂度也随之快速增加。

周于皓 并不否认高自由度的意义。他在采访中提到,高自由度确实能够带来更丰富的操作能力,但同时需要更复杂的 learning-based method,机械系统本身也更容易 面对过热、关节故障等工程问题,故障率远高于工厂里的平行夹爪。

因此,他们团队想探索的是两个极端之间的区域:「会不会三指就已经足够完成大部分任务了?」

在 周于皓 看来, 控制简单度和 dexterity 之间并不是简单的线性关系,可能存在一个更合适的设计区间。

因此,VTAP 没有继续卷手指数量。它有三根手指,每根手指 4 个自由度,但团队把 palm 也纳入操作系统:手掌不再只是一个被动的固定支撑面,而可以主动接近物体、施力、稳定物体,并重新分配 contact。

论文把这个设计概括为: 不是继续增加更多 contact surfaces,而是让已有的 contact surfaces 变得更有用。

周于皓 举了两个例子。一个是防儿童开启瓶盖。人拧这种瓶盖时,往往需要一边向下按,一边旋转。如果机器人完全依赖手指完成这些动作,需要协调更多关节;而在 VTAP Gripper 上,active palm 可以负责向下按压,手指负责固定和旋转。

另一个是注射器。夹爪先用两根手指拿住并调整注射器,再直接利用 palm 按下推杆。手指与手掌分别承担任务,减少对复杂手指姿态的依赖。

他特别强调 ,「它不是说能解决新的问题,而是说利用一个 active palm 加上 perception,能够用简单的方式去解决一些问题。」

这也是 VTAP 最核心的设计判断:Dexterity 不一定只来自更多 DoF,也可以来自对现有身体结构更有效的利用。

一块手掌,两种模式

如果手掌要承担推压、稳定和持物,它就还需要提供操作中的反馈。

让手掌动起来只是第一步。 VTAP 的另一个核心,是让这块手掌同时成为 sensing surface。

团队在硅胶表面使用了一层半透明反射涂层,并通过内部 LED 控制其工作状态。

LED 关闭时,外部光线能够穿过涂层,内部 camera 可以观察手掌前方和手内物体,相当于一枚 in-hand camera。

打开内部光源后,光线从涂层反射回来,接触造成的表面形变则会被 camera 捕捉,系统转入 tactile sensing。

同一套 camera 和同一个 sensing surface,只需要一个电源开关,可以通过切换照明,在 vision 和 tactile 之间转换。

周于皓 在采访中进一步解释,视觉模式的可见范围与清晰度,可以通过视场以及表面涂层等参数调整;切换到触觉模式后,图像中的形变可以作为后续处理的输入,用于几何重建或力 估计等任务。

两种模式分别对应操作中的不同信息需求。视觉可以观察手指与物体的相对关系,触觉则记录实际接触表面的细节。

在自主插销入孔演示中,系统先用 vision 完成视觉粗定位,再切换 tactile mode 进行更精细的探索和几何估计。项目页报告称,该任务是在 1 毫米公差条件下完成插入的。

团队还展示了利用触觉反馈的自主抓取,以及通过遥操作完成的注射器手内调整、推杆按压和单体分离。单体分离指的是,从抓住的一组小物体中分离出一个物体。这些展示分别体现了感知反馈、机构能力和遥操作系统的作用,并非都由自主学习策略完成。

指尖触觉与手掌感知也承担着不同作用。三根手指上另外布置了柔性触觉阵列传感器。 周于皓 特别提到,手掌内的视觉能够观察手内操作时,指尖与物体发生接触的场景;当手掌也参与抓持或推压时,其触觉又可以提供额外输入。他希望这些模态最终能一起为操作策略服务。

在软糖熊、不规则物体等单体分离展示中,这种接触信息的变化尤其直观。多个物体同时接触手指时,信号比较复杂;分离完成后,留在手中的单个物体形成了更清晰的接触模式。

这些感知方式提供了理解两类问题的线索:物体在手里「在哪里」,以及手和物体之间「正在发生什么」。

五指人手如何控制三指夹爪 ?

不过,要让人控制这样的夹爪,还需要跨过另一道障碍。

人手有五根手指,VTAP 有三根;两者的关节排列、可达空间与基准坐标方向也不同。这些身体结构差异,使人手与夹爪之间的直接动作迁移变得困难。

如果直接把人的关节角度映射给机器人,很难适应这些几何和运动学差异。

因此,团队又设计了一套 retargeting framework。

第一步,根据操作者的手势,判断属于 cage、power、pinch 等哪一类功能性抓取类别,以缩小机器人可能采用的构型范围,减少相同人手动作对应多个机器人姿态时的歧义。

再引入一个中间坐标系,处理人手腕坐标系与夹爪坐标系之间的差别,尽量保持指尖相对位置和指尖朝向等与任务有关的几何关系,并加入平滑约束,使动作更加稳定。

周于皓解释 ,已有的五指映射多以腕部为坐标系,而三指夹爪工作在三维空间里,所以要重新定义坐标系。他关心指尖的位置关系,以及指尖相对于手部坐标系的距离和 方向;通过优化方法实时求解,输出夹爪的关节控制。他介绍,输入可以通过 Meta Quest 获得的人手骨架信息提供。

借助这套系统,操作者可以通过人手动作控制三指夹爪,并用于 demonstration collection。

同时,VTAP 本身又能同步记录 fingertip force、palm vision、palm tactile,以及机器人状态。

在 周于皓 看来,手内操作时指尖与物体的接触、物体形变,以及手掌参与操作产生的信息,都可能帮助模仿学习或强化学习。

这样来看,VTAP 不只是一只夹爪,也可能成为一套 contact-rich manipulation data collection platform。

他也直说了这套系统的局限: 基于硅胶的光学表面会磨损,一旦磨损,触觉和视觉信号都会受损。 他认为这是有待解决的工程问题,可能涉及材料,一旦解决,有机会落地到真实工业环境。

在 周于皓 看来,目前很多具身模型已经能够依赖外部相机较好地理解 scene,但需要触觉才能感知的精细信息,对应的数据仍然很少。

真正限制 tactile learning 继续扩大规模的因素之一,是过去缺少这样的 data,也缺少在这些数据基础上训练出的 foundation models。目前没有公认最好的触觉传感器,也没有像 ImageNet 那样的大规模数据集。至于不同机器人之间共享触觉数据,什么会成为「共同语言」,他坦承自己也没有答案。

目前团队更多是把 VTAP 看作一个硬件和数据平台。 周于皓 表示,他们希望接下来利用 full-hand、multimodal sensing 采集更多数据,并进一步研究这些模态该怎样融合、怎样真正进入 policy。

回到最初那个瓶盖,手掌动起来了,手上也有了更丰富的触觉,但拥有触觉,并不等于机器人已经学会用它。甚至,更多触觉也有可能让 policy 变得更差。

在 IROS 2026 现场,我们看到 Purdue MARS Lab 的另一项工作《CONTACT: CONtact-aware TACTile Learning for Robotic Disassembly》中,已经在追问:机器人已经能够「摸到」之后,到底什么样的触觉信息才真的有用?