VLA开环盲区,终于被堵上了:40M Corrector让机器人边做边纠错
创始人
2026-09-05 15:33:34
0

(来源:机器之心)

机器人抓住积木,正准备往碗里放。就在这时,有人突然把碗挪走了。

人会本能地停一下、看一眼,再重新对准;但不少 VLA 机器人不会。它明明还在接收相机画面,手上却继续执行几百毫秒前生成的旧动作,最后把积木放进空气里。

这不是模型「没看见」,而是它在这段时间里,根本没被允许重新思考。

浙江大学 ACES 实验室 OmniAI 团队与阿里巴巴达摩院的最新工作 VLA-Corrector,盯住了这个长期被 action chunk 掩盖的问题:VLA 一次预测一串动作确实高效,但从开始执行到下一次推理之间,也出现了一块危险的开环盲区

  • 论文: VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon

  • 作者: Yi Pan, Miao Pan, Qi Lu, Jiaming Huang, Man Zhang, Siteng Huang, Xin Li, Jie Zhang, Yongliang Shen, Xuhong Zhang, Wenqi Zhang

  • 单位: Zhejiang University;Alibaba DAMO Academy

  • 论文链接:https://arxiv.org/abs/2607.01804

  • 项目主页:https://zju-omniai.github.io/vla-corrector/

  • 代码:https://github.com/ZJU-OmniAI/vla-corrector

他们给出的答案很直接:不必逼大模型每一步都重算,也别让机器人闭着眼把整段动作做完。给 VLA 加一个约 40M 参数的轻量级 Corrector,让它知道什么时候该继续,什么时候必须停手纠错。

长 action horizon 与严格闭环执行的对比

VLA 明明一直睁着眼,为什么还像没看见?

现在主流的生成式 VLA,常用 action chunk 来摊薄推理成本:模型看一次画面,一口气生成未来一段动作;机器人再从中连续执行前 H 步。H 越大,调用模型的次数越少,动作也更连贯。

代价同样明显。抓取时打滑、插入时偏了两毫米,或者目标被人移动,后面的动作就已经「过期」了。但只要 horizon 还没结束,机器人仍会照着旧计划往下做。小偏差很快滚成大错误,等下一次推理终于到来,状态可能已经偏到救不回来了。

把 H 设成 1,当然可以步步闭环,却等于每个控制步都调用一次 VLA。论文的 horizon sweep 也把这笔账算得很清楚:以 π0.5 为例,拉长 horizon 能把 policy call 降低约 4 倍,但成功率会从约 64% 掉到 49% 以下。

所以,问题并不是再猜一个「最佳 H」。真正该问的是:当前这段动作,什么时候已经不值得信了?

不要一直重规划,

只在动作失效的那一刻接管

VLA-Corrector 没有改动 VLA 主干权重,而是在推理链路外加了一条「监测—打断—纠正」的旁路。

第一步是监测。Latent-space Vision Monitor(LVM)学习一个很局部的问题:执行这个动作后,视觉特征接下来应该往哪个方向变化?在线运行时,它不断比较「预期变化」和相机里「真实发生的变化」。模型不是直接预测像素,而是在信息密度高的 latent space 中预测视觉动态残差。这样有助于减少静态背景,光照的干扰,让模型优先关注对执行任务而言重要的动态部分,降低学习难度的同时还能让预测更加准确。

第二步是打断。如果这种偏差持续出现,而非单帧抖动,系统立刻清空队列中尚未执行的 stale actions。动态阈值、迟滞机制和连续步检查,保证它不会一有风吹草动就停机。

第三步才是纠正。简单地再问一次 VLA,可能只会得到另一段同样出不去的动作。为此,Online Gradient Guidance(OGG)会把刚才检测到的视觉偏差变成梯度信号,只引导中断后的那一次恢复推理,把新动作往更可恢复的方向推。

这套机制最终得到的不是另一个固定 horizon,而是事件触发的自适应 horizon:搬运平稳时,大步往前走;到了抓取、对齐、插入这些容易出错的阶段,随时准备切回短视野纠错。实验中,83.7% 的截断恰好发生在这些关键阶段。

换句话说,它不是在开环和闭环之间二选一,而是把闭环反馈用在了最值钱的时刻。

成功率涨了,调用次数反而还能降

在 MetaWorld 上,给 π0.5 加入 VLA-Corrector 后,平均成功率从 48.70% 提升到 64.35%;在 Very Hard 任务上,提升达到 24 个百分点

更有意思的是,它并不是靠疯狂增加推理次数换来的。SmolVLA 在 horizon 10 下,成功率从 61.90% 提升到 73.00%,平均 policy call 却从19.27 次降到 15.64 次。原因不难理解:及时扔掉过期动作,远比在失败轨迹上继续浪费整段 chunk 划算。

真实 AgileX PiPER 机械臂上的结果更直观。九项任务的平均成功率从 55.6% 提升到 73.3%;在人为移动物体或目标的扰动恢复任务中,成功率从 40.0% 跃升到 68.3%。而在 LIBERO 上,加入 Corrector 的 few-shot 模型达到97.8%,还超过了 fully fine-tuned baseline 的 96.95%。

这项工作真正值得带走的 insight

过去我们常把 VLA 的可靠性理解成「第一次就预测出完美动作」。但机器人进入物理世界后,动作会反过来改变环境,计划也会随时过期。一个永远不犯错的长动作块并不现实,真正重要的是:系统能不能尽早知道自己已经走偏,并保留打断自己的权力。

VLA-Corrector 给出了一种很有启发的系统分工:大模型负责提出计划,小模型负责审计计划,执行层拥有随时叫停的权力。这可能比一味堆大 backbone 更接近具身智能的可靠落地。

它当然不是万能恢复器。OGG 仍受基础策略能力上限约束。但VLA-Corrector真正的核心在于它能有效抑制错误在开环盲区中被放大,大幅降低VLA policy从错误中恢复的难度。它改变了问题的解法:不再要求 VLA 时时严格闭环,而是让系统在该闭环的瞬间,真的闭上这个环。

一句话概括:机器人未必需要永远不出错,但它必须学会不把错误继续做完。

作者介绍

本工作由浙江大学 OmniAI 团队与阿里巴巴达摩院联合完成,第一作者是浙大准研一的硕士研究生潘翼,研究聚焦 action-chunked VLA 的开环盲区与真实机器人纠错,通讯作者为浙大百人计划研究员张文祺。

相关内容

日本警方以涉嫌暴行罪逮捕2...
冲绳县警察本部冲绳警察署5日透露,当地警方以涉嫌暴行罪,逮捕了两名...
2026-09-05 16:19:19
泥石流灾害后群众转移安置,...
(来源:农视网)9月4日,记者从西藏自治区吉隆县“8·26”泥石流...
2026-09-05 16:19:12
消保课堂 | 守护财富安全...
消保课堂守护金融权益,数智温暖民生守护财富安全从了解洗钱新套路开始...
2026-09-05 16:19:03
1岁裸体男童在海拔3200...
(来源:河北新闻网)去年,在海拔3200米的青海都兰县牧区曾发生一...
2026-09-05 16:18:55
女子一口吞下,竟导致咽喉糜...
(来源:新密发布)嫌烧水晾凉太麻烦近日江苏扬州的张女士竟直接干吞止...
2026-09-05 16:18:43
来沪八年,这个德国人为啥说...
(来源:上观新闻)w ǒ j i à o r á o f ú “我...
2026-09-05 16:18:35
《天津日报》刊登:天津老建...
今天(9月5日)《天津日报》刊登:天津老建筑“长”出新业态,一起来...
2026-09-05 16:18:24
医聊 | 脂肪肝,真的只是...
你身边有没有这样的人——不胖,吃得很清淡,结果体检单上写着“脂肪肝...
2026-09-05 16:18:15
举报无证生产危险化学品,属...
近日,江西省应急管理厅公布3起安全生产举报奖励案例和5起生产经营单...
2026-09-05 16:18:08

热门资讯

日本警方以涉嫌暴行罪逮捕2名驻... 冲绳县警察本部冲绳警察署5日透露,当地警方以涉嫌暴行罪,逮捕了两名隶属于驻日美军科特尼营(位于冲绳县...
泥石流灾害后群众转移安置,他们... (来源:农视网)9月4日,记者从西藏自治区吉隆县“8·26”泥石流灾害前方指挥部了解到,灾害发生后,...
消保课堂 | 守护财富安全,从... 消保课堂守护金融权益,数智温暖民生守护财富安全从了解洗钱新套路开始提到“洗钱”,很多人的第一反应是银...
1岁裸体男童在海拔3200米沙... (来源:河北新闻网)去年,在海拔3200米的青海都兰县牧区曾发生一起男童走失事件。今天,央视新闻披露...
女子一口吞下,竟导致咽喉糜烂,... (来源:新密发布)嫌烧水晾凉太麻烦近日江苏扬州的张女士竟直接干吞止泻药蒙脱石散结果造成咽喉黏膜糜烂疼...
来沪八年,这个德国人为啥说金山... (来源:上观新闻)w ǒ j i à o r á o f ú “我叫饶福,富饶的饶,幸福的福。” 一...
《天津日报》刊登:天津老建筑“... 今天(9月5日)《天津日报》刊登:天津老建筑“长”出新业态,一起来看看吧!“建筑,是一座城市的无声叙...
医聊 | 脂肪肝,真的只是“吃... 你身边有没有这样的人——不胖,吃得很清淡,结果体检单上写着“脂肪肝”一个冷知识:脂肪肝,不是胖人的专...
举报无证生产危险化学品,属实!... 近日,江西省应急管理厅公布3起安全生产举报奖励案例和5起生产经营单位事故隐患内部报告奖励案例,其中3...
消息人士称Anthropic ... 当地时间9月4日,据报道,人工智能公司Anthropic预计最早将于十月中旬开始为其首次公开募股(I...