朱曦霖
联系Available for work
← 全部作品

硕士毕业论文 · FZI 信息技术研究中心

人手状态条件 VLA

面向时序感知人机协作的手部状态条件化视觉-语言-动作模型

2026.09 — 2027.02进行中

本项目正在进行中,尚无实验结果。以下是研究设计。

让协作机器人不只知道「做什么」,还知道「什么时候动手」——把协作者手部的三维位置与速度作为一个低维状态 token 注入 VLA 策略,检验它能否在保留长执行时域的同时减少过早动作。

论文周期(周)
26
Go/No-Go 决策点(第 N 周)
10
同协议对照组数
4
时序扰动试验占比
≥30%
感知流水线频率
≥10 Hz
参与协作者人数
≥3

问题

在人机协作装配里,机器人必须同时决定执行什么何时行动。把 VLA 与动作分块(action chunking)结合,可以从示范中端到端学到协作操作,但困难恰恰出在分块上。

策略一次预测一个未来动作块,执行完其中前 $T_a$ 个动作才重新规划。如果一个动作块跨越了示范中「等待」与「协助」之间的边界,机器人就会在人还没准备好时伸手——已有研究把这种失效称为示范动作泄漏,并发现它随执行时域增长而恶化。

于是 $T_a$ 变成一个直接影响协作效率的旋钮:

  • $T_a$ 小 → 反应快,但运动不连续、推理成本高
  • $T_a$ 大 → 平滑高效,但容易过早动作

这篇论文问的不是「在这条权衡曲线上选哪个折中点」,而是能不能整体把这条曲线移下去

三条现有路线,各差一步

现有路线 做到了什么 差在哪
时序干预 用末端执行器位置做推理期引导;用内部注意力权重做自适应时域;用反思模块请求帮助 都没有直接以协作者的连续状态作为动作执行条件
人体线索 注视与手势用于确定操作哪个物体;手部姿态被用作辅助预测目标 处理的是「操作什么」,不是「何时行动」
人体运动预测 预测人体运动并输入闭环 MPC 规划器;手部运动被用作移交意图的独立检测器 规划领域已经用上了,但 VLA 决定动作块执行多久时,触发信号仍来自机器人内部

做法

主方案是一条低维状态通道。 用一个小型投影网络把手部状态向量映射到模型的嵌入空间,作为一个额外 token,与视觉、语言 token 一起进入序列。沿用 OpenVLA-OFT 注入机器人本体感知状态的方式,不改主干架构

同协议四组对照

这是整个评估的核心:三条注入路径分别对应三项已发表工作的立场,此前从未被放在一起测量。

手部信息怎么用 立场
状态 token 低维向量投影成一个输入 token 本论文方案
像素叠加 把手部骨架画进观测图像 能显示手在哪,但编码不了三维速度——而区分「正在伸手」和「正在撤回」靠的正是速度
辅助监督 手部姿态作为辅助预测目标,推理时关闭 是训练信号,不是策略输入
无手信息 完全不用 基线

任务与数据

核心任务是有时序要求的物体移交:机器人持物待命,协作者按随机化时序脚本伸手,脚本覆盖提前、准时、延迟、假动作、伸手途中撤回五种情况。

这些扰动有两个作用:在「该等」与「该动」的观测之间制造受控歧义;以及它是区分学习策略与固定距离阈值的唯一方法——固定阈值处理不了撤回。另设一项指令触发的抓取任务作为控制任务。

数据 10 Hz 记录:多视角 RGB、机器人本体感知状态、动作、带时间戳的手部状态、阶段标注。已有研究报告,单示范者训练出的策略在换人时会退回固定套路,因此训练覆盖多名协作者,评估用未出现在训练集中的人。

感知流水线

手部关键点通过对齐深度提升到三维,再转换到机器人基坐标系;手部速度由短缓冲区内的位置差分得到。

模型

主干为 LoRA 微调的 $\pi_{0.5}$。OpenVLA-OFT+ 只用于少量离线控制点,检验结论是否依赖单一架构。

核心假设:观测混叠

过早动作可能部分源于阶段转换边界附近的观测混叠:在从等待过渡到协助的区间内,视觉上相似的 RGB 观测对应互不相容的目标动作,基于回归的策略于是在这些动作标签之间作折中,表现为过早伸手。

手部状态是一种低维但有时间判别力的信号,可能把这两种情况区分开。

三个研究问题

RQ 问题 实验
RQ1 以手部状态为条件能否减少过早动作?效果如何随 $T_a$ 变化? 成对执行时域扫描。$T_a$ 是推理期参数,扫描不需重训,两个检查点即可覆盖整张结果图
RQ2 手部信息的使用方式影响多大? 同数据、同主干、同 $T_a$ 下比较四个系统
RQ3 若有改善,来自信息本身、参数量,还是一条无需学习的规则? 三项归因控制

RQ3 的三项归因控制

这部分是整个设计里我自己最看重的地方,因为它在主动尝试推翻自己的结论

  1. 等待数据增强——给基线加等量等待片段,检验增益是否只来自训练数据分布变化
  2. 时间打乱的手部状态——架构与参数量完全不变,只在时间上打乱手部状态,检验增益是否依赖时间结构,还是只来自额外参数与静态位置信息
  3. 脚本化门控——用手部距离、径向速度、停留时间与滞回机制写一条无需学习的规则,检验规则是否已经够用。时序扰动条件是这项控制的关键,因为规则处理不了撤回动作

判据(预先写死,避免事后找解释)

支持:长执行时域下错误承诺少于基线,成对差异置信区间不含零;同时不增加等待漂移与反应延迟、不降低任务成功率;优势在时序扰动条件下比正常时序更明显。

证伪:两条成对曲线统计上不可区分;或等待数据增强消除增益;或表示分析未显示观测混叠降低。

鲁棒性要求

没有可靠手部信息时,新增路径必须退化为无作用路径:训练期随机丢弃手部状态并配合专用「缺失状态嵌入」,检测器失效情景的实验验证策略确实恢复为基线行为。

指标定义

指标 定义
错误承诺 一次完整但过早的物体移交
等待漂移 末端执行器在等待阶段累计经过的路径长度
反应延迟 人发出准备信号到机器人开始动作的时间
目标物体选择准确率 「操作哪个对象」维度的正确率

时间安排

实验阶段与写作阶段有意重叠,决定性的 Go/No-Go 测试排在前期。

工作内容 周次
手部状态流水线与基线 1–5
数据收集 3–7
决定性执行时域扫描 6–10
离线观测混叠分析 8–12
归因控制与注入方法消融 9–14
非正式试跑与检测器失效检查 13–20
论文撰写 1–23
最终修订与导师反馈 21–26

记录任何人体数据之前,先与指导人员确认数据保护与参与者知情同意流程。