(来源:机器之心)
机器人正在变得越来越「通用」。
从抓取日常物品,到根据语言指令完成多步骤操作,视觉 — 语言 — 动作(VLA)模型正在让机器人摆脱过去「一项任务、一套程序」的开发方式。但当机器人真正走向制造现场,问题也随之发生了变化:会不会做,已经不是唯一标准;能不能在毫米甚至亚毫米级接触中稳定完成,并在出错后自己恢复,才决定它能否真正进入生产环节。
精密装配恰恰是这道门槛最集中的地方。零件可能已经「看起来对齐」,却在最后几毫米发生偏斜、卡滞;一次没有恢复的异常,就可能让整条任务链中断。
项目地址:https://pine-lab-ntu.github.io/facet-0/
论文链接:https://arxiv.org/abs/2609.01596
针对这一问题,新加坡南洋理工大学(NTU)PINE Lab 团队研发了面向接触丰富型精密操作的机器人基础模型 Facet-0,试图让机器人不仅理解「要做什么」,还能够在真实接触中判断「做得对不对」,并根据失败经验持续改进。
Facet-0 完成 RAM、CPU、Disk、GPU 等装配任务
在五项真实机器人计算机装配任务中,Facet-0 取得 82% 的平均任务成功率;作为对比,π0.5 为 10%,GR00T N1.7 为 4%。模型的放置精度达到 0.5 mm,指令延迟约 50 ms。
这不是自由空间抓取的演示,而是一套包含 23 个子目标、多个对齐、插入、压合和锁定步骤的精密装配评测,其中大量关键步骤发生在 0.10–0.30 mm 的装配间隙中。
更重要的是,82% 并不是单纯依靠扩大预训练得到的。Facet-0 的完整训练流程将成功率从预训练阶段的 16% 提升到 RL 后训练阶段的 38%,再通过轻量化适配达到 82%。在部署后训练对比中,人工干预率由 47% 降至 24%,失败恢复率由 44% 提升至 81%。
发生卡滞后回撤、重新对齐并完成插入对于从未见过的内存模块,Facet-0 只使用 10 条示范、约 3 小时训练,并更新 6.6% 的参数,即达到 45% 成功率;最强基线为 5%。
为什么精密制造需要新的机器人模型?
通用 VLA 模型已经能够理解指令、识别物体,并完成许多日常操作。但制造现场真正困难的部分,往往发生在视觉「已经完成任务」之后。
当零件进入最后几毫米,机器人面对的不再只是「零件在哪里」,而是:是否真正对准了插槽?接触力是在正常增长,还是已经发生偏斜?继续向下压,究竟会完成装配,还是把一次小误差变成卡死?
视觉擅长提供语义和几何信息,却可能看不见被夹具、机械臂遮挡的微小偏差;力 / 力矩传感器则能够直接反映接触状态。一个零件位置几乎没有变化,但力持续增大,本身就是视觉难以提供的失败信号。
因此,精密装配需要解决的不只是「让机器人感知到力」,而是让视觉、语言、本体状态和力觉真正参与同一条决策链:看懂任务、判断接触、及时修正,并在失败后继续完成任务。
ManuFacet-1K:
面向高精度接触操作的数据基础
要让模型学会这种能力,首先需要让数据本身包含「接触是如何发生的」。
ManuFacet-1K 包含约 1000 小时的力同步示范与闭环运行数据,覆盖 UR7e、xArm、Franka 三种机械臂、两类服务器机箱,以及 GPU、RAM、CPU、Disk 四类安装任务。
数据集的特色不在于重新宣称一种通用采集基础设施,而在于围绕精密操作进行统一设计:每一帧同步记录多视角图像、语言指令、末端位姿、夹爪状态和六维力 / 力矩,并按照接近、对齐、插入、压合、就位、紧固、撤离等技能阶段进行标注。
更关键的是,数据并没有只保留「正确答案」。真实部署中的失败、人工接管以及随后发生的恢复过程也被留下来。
这意味着,模型学习的不再只是「成功轨迹长什么样」,还能够看到:一个动作如何产生接触,一次正常接触和一次卡滞有什么区别,以及错误发生以后,怎样重新回到可完成任务的状态。
Facet-0:把 VLA 的语义动作与力觉控制对齐
有了力觉数据,下一个问题随之出现:机器人「感觉到了力」,就一定知道该怎么做吗?
答案并不必然如此。如果力觉只是作为一个额外输入进入 VLA,而训练目标仍然只要求模型模仿位置动作,那么在海量视觉特征面前,这几个力觉维度依然可能被忽略;即使模型知道发生了碰撞,原有的位置控制接口也未必允许它及时停止、回撤和重新对齐。
Facet-0 因此建立了一条从 VLA 语义决策到接触控制的对齐通路:
1. 模型同时接收多视角图像、语言指令、机器人本体状态和六维力 / 力矩历史;力觉作为独立信号进入模型,让接触状态在模型内部能够被明确表示。
2. 动作专家先生成任务相关的粗粒度动作 — 力觉片段;进入接触阶段后,精化专家结合实时力觉,把它进一步转化为更细粒度的动作,使「要完成什么」和「接触时应该怎样调整」连接起来。
3. 高频合规控制器执行最终指令,并施加工作空间、单步运动等安全约束,让模型的判断真正落实到物理交互中。
因此,Facet-0 想解决的并不是「机器人有没有力传感器」,而是更深一层的问题:机器人能否把接触变成一种真正可理解、可评价、也可行动的信息。
面向接触质量与自主恢复的强化学习后训练
但即使机器人已经能够感知和控制接触,还有一个更难的问题:一次装配最终成功了,是否意味着中间所有动作都值得学习?
答案同样是否定的。两个策略都可能最终把 RAM 插进去,一个轻微调整后完成就位,另一个则持续硬顶、产生远高于正常水平的接触力。如果强化学习只在任务结束时看到一个「成功」,这两条轨迹获得的评价几乎没有区别。
Facet-0 的 RL 后训练,正是从这里开始。
第一步,是把「最终有没有成功」拆成「每一步到底做得怎么样」。
系统按照对齐、插入、压合、就位等子任务进行信用分配。一次轨迹即使中间发生失败,只要机器人随后成功回撤、重新对齐并完成当前阶段,这段恢复行为仍然可以得到正向评价,而不会因为整条轨迹曾经出错就被一起丢弃。
但只看阶段是否完成仍然不够,于是第二步开始判断「是怎样完成的」。
Facet-0 的价值模型同时结合动作和力 / 力矩变化评估接触质量。过大的接触力会降低信用,因此即使两个动作都完成了插入,温和对齐也会获得比强行顶撞更高的价值。机器人学习的由此不再只是「成功动作」,而是「更值得重复的成功动作」。
接下来还要解决一个容易被忽略的问题:真正决定装配成败的接触片段,在整条轨迹里往往只占很小一部分。
如果把所有时刻放在一起排序,大量自由空间运动会淹没那些短暂但关键的接触动作。Facet-0 因此分别在接触阶段和自由空间阶段进行信用筛选,把学习重点重新拉回对齐、插入、卡滞和恢复这些真正决定结果的瞬间。
最后,这些价值判断必须重新影响策略本身。
经过筛选的高价值接触经验被用于强化动作专家,使模型不仅知道哪些轨迹成功,还逐渐形成对「接下来应该产生怎样的动作和接触状态」的判断。与此同时,真实部署中的成功、失败、人工接管和恢复轨迹持续回流到训练环节,形成从运行 → 发现异常 → 人工纠正 / 自主恢复 → 价值评估 → 策略更新的闭环。
这也是 Facet-0 的 RL 后训练与单纯「拿部署数据继续训练」的区别:它试图解决的不是如何让平均轨迹再好一点,而是如何让少数真正会让生产中断的失败,被模型看见、被正确评价,并最终变成下一次能够自主恢复的经验。
这套机制使人工干预率从 47% 降至 24%,失败恢复率从 44% 提升至 81%。轻量化适配模块随后负责把已经学到的接触能力迁移到新的零件和工况,而无需重新训练整个 VLA。
从一次成功走向持续进化
对于制造机器人而言,真正难以规模化的,从来不是做出一次漂亮的 Demo。
生产现场更关心的是:第 100 次遇到微小偏差时,它是否仍然能够完成;出现一个训练集中没有覆盖的卡滞时,它能否自己退回来;更换零件、工装乃至机器人平台之后,又需要付出多少重新调试的成本。
Facet-0 给出的并不是所有精密制造问题的最终答案,而是一条值得关注的技术路径:以力同步的高精度数据建立接触基础,以多模态模型连接语义与物理交互,再通过真实部署中的强化学习,把失败从「异常」变成能够被持续利用的训练信号。
这背后也对应着机器人基础模型从通用操作走向工业落地时的一次能力迁移 —— 从「看见并执行」,进一步走向「接触、判断、修正和积累经验」。
未来,PINE Lab 将继续扩大长尾零件和工况覆盖,探索更统一的语义 — 力觉建模,以及面向长期部署的安全持续学习。
因为在精密制造中,决定机器人能否真正进入生产线的,可能并不是它在理想情况下成功了多少次,而是当那一次不可避免的失败到来时,它能不能自己把任务继续做下去。