问题
在人机协作装配里,机器人必须同时决定执行什么和何时行动。把 VLA 与动作分块(action chunking)结合,可以从示范中端到端学到协作操作,但困难恰恰出在分块上。
策略一次预测一个未来动作块,执行完其中前 $T_a$ 个动作才重新规划。如果一个动作块跨越了示范中「等待」与「协助」之间的边界,机器人就会在人还没准备好时伸手——已有研究把这种失效称为示范动作泄漏,并发现它随执行时域增长而恶化。
于是 $T_a$ 变成一个直接影响协作效率的旋钮:
- $T_a$ 小 → 反应快,但运动不连续、推理成本高
- $T_a$ 大 → 平滑高效,但容易过早动作
这篇论文问的不是「在这条权衡曲线上选哪个折中点」,而是能不能整体把这条曲线移下去。
三条现有路线,各差一步
| 现有路线 | 做到了什么 | 差在哪 |
|---|---|---|
| 时序干预 | 用末端执行器位置做推理期引导;用内部注意力权重做自适应时域;用反思模块请求帮助 | 都没有直接以协作者的连续状态作为动作执行条件 |
| 人体线索 | 注视与手势用于确定操作哪个物体;手部姿态被用作辅助预测目标 | 处理的是「操作什么」,不是「何时行动」 |
| 人体运动预测 | 预测人体运动并输入闭环 MPC 规划器;手部运动被用作移交意图的独立检测器 | 规划领域已经用上了,但 VLA 决定动作块执行多久时,触发信号仍来自机器人内部 |
做法
主方案是一条低维状态通道。 用一个小型投影网络把手部状态向量映射到模型的嵌入空间,作为一个额外 token,与视觉、语言 token 一起进入序列。沿用 OpenVLA-OFT 注入机器人本体感知状态的方式,不改主干架构。
同协议四组对照
这是整个评估的核心:三条注入路径分别对应三项已发表工作的立场,此前从未被放在一起测量。
| 组 | 手部信息怎么用 | 立场 |
|---|---|---|
| 状态 token | 低维向量投影成一个输入 token | 本论文方案 |
| 像素叠加 | 把手部骨架画进观测图像 | 能显示手在哪,但编码不了三维速度——而区分「正在伸手」和「正在撤回」靠的正是速度 |
| 辅助监督 | 手部姿态作为辅助预测目标,推理时关闭 | 是训练信号,不是策略输入 |
| 无手信息 | 完全不用 | 基线 |
任务与数据
核心任务是有时序要求的物体移交:机器人持物待命,协作者按随机化时序脚本伸手,脚本覆盖提前、准时、延迟、假动作、伸手途中撤回五种情况。
这些扰动有两个作用:在「该等」与「该动」的观测之间制造受控歧义;以及它是区分学习策略与固定距离阈值的唯一方法——固定阈值处理不了撤回。另设一项指令触发的抓取任务作为控制任务。
数据 10 Hz 记录:多视角 RGB、机器人本体感知状态、动作、带时间戳的手部状态、阶段标注。已有研究报告,单示范者训练出的策略在换人时会退回固定套路,因此训练覆盖多名协作者,评估用未出现在训练集中的人。
感知流水线
手部关键点通过对齐深度提升到三维,再转换到机器人基坐标系;手部速度由短缓冲区内的位置差分得到。
模型
主干为 LoRA 微调的 $\pi_{0.5}$。OpenVLA-OFT+ 只用于少量离线控制点,检验结论是否依赖单一架构。
核心假设:观测混叠
过早动作可能部分源于阶段转换边界附近的观测混叠:在从等待过渡到协助的区间内,视觉上相似的 RGB 观测对应互不相容的目标动作,基于回归的策略于是在这些动作标签之间作折中,表现为过早伸手。
手部状态是一种低维但有时间判别力的信号,可能把这两种情况区分开。
三个研究问题
| RQ | 问题 | 实验 |
|---|---|---|
| RQ1 | 以手部状态为条件能否减少过早动作?效果如何随 $T_a$ 变化? | 成对执行时域扫描。$T_a$ 是推理期参数,扫描不需重训,两个检查点即可覆盖整张结果图 |
| RQ2 | 手部信息的使用方式影响多大? | 同数据、同主干、同 $T_a$ 下比较四个系统 |
| RQ3 | 若有改善,来自信息本身、参数量,还是一条无需学习的规则? | 三项归因控制 |
RQ3 的三项归因控制
这部分是整个设计里我自己最看重的地方,因为它在主动尝试推翻自己的结论:
- 等待数据增强——给基线加等量等待片段,检验增益是否只来自训练数据分布变化
- 时间打乱的手部状态——架构与参数量完全不变,只在时间上打乱手部状态,检验增益是否依赖时间结构,还是只来自额外参数与静态位置信息
- 脚本化门控——用手部距离、径向速度、停留时间与滞回机制写一条无需学习的规则,检验规则是否已经够用。时序扰动条件是这项控制的关键,因为规则处理不了撤回动作
判据(预先写死,避免事后找解释)
支持:长执行时域下错误承诺少于基线,成对差异置信区间不含零;同时不增加等待漂移与反应延迟、不降低任务成功率;优势在时序扰动条件下比正常时序更明显。
证伪:两条成对曲线统计上不可区分;或等待数据增强消除增益;或表示分析未显示观测混叠降低。
鲁棒性要求
没有可靠手部信息时,新增路径必须退化为无作用路径:训练期随机丢弃手部状态并配合专用「缺失状态嵌入」,检测器失效情景的实验验证策略确实恢复为基线行为。
指标定义
| 指标 | 定义 |
|---|---|
| 错误承诺 | 一次完整但过早的物体移交 |
| 等待漂移 | 末端执行器在等待阶段累计经过的路径长度 |
| 反应延迟 | 人发出准备信号到机器人开始动作的时间 |
| 目标物体选择准确率 | 「操作哪个对象」维度的正确率 |
时间安排
实验阶段与写作阶段有意重叠,决定性的 Go/No-Go 测试排在前期。
| 工作内容 | 周次 |
|---|---|
| 手部状态流水线与基线 | 1–5 |
| 数据收集 | 3–7 |
| 决定性执行时域扫描 | 6–10 |
| 离线观测混叠分析 | 8–12 |
| 归因控制与注入方法消融 | 9–14 |
| 非正式试跑与检测器失效检查 | 13–20 |
| 论文撰写 | 1–23 |
| 最终修订与导师反馈 | 21–26 |
记录任何人体数据之前,先与指导人员确认数据保护与参与者知情同意流程。