微信内可能无法直接打开本站。请点右上角 ··· → 在浏览器打开,或复制链接。
IJCAI 2026 专访:动作指挥计算,VLA 加速不降准 | GAIR Paper 125
RSS 官方收录 · 可信分层展示
关键摘要
将动作从输出端搬到调度端,推理速度提升1.79倍。作者丨邓哲敏 编辑丨齐铖湧 机器人想要真正走进千行百业、千家万户,有一道绕不开的坎:它得足够快。不说快到能打羽毛球那,至少得快到让人觉得这玩意儿能用。…
- 一个机械臂每动一下都要停顿两三秒,哪怕成功率再高,在工业场景里算下来的投入产出比也很难说服人。
- VLA 模型是当前具身智能领域最受关注的技术路线之一。
- 它把视觉感知、语言理解和动作生成整合进一套模型,让机器人能够依据语言指令完成复杂操作任务。
摘要引擎:抽取
正文提要

作者丨邓哲敏
编辑丨齐铖湧
机器人想要真正走进千行百业、千家万户,有一道绕不开的坎:它得足够快。
不说快到能打羽毛球那,至少得快到让人觉得这玩意儿能用。一个机械臂每动一下都要停顿两三秒,哪怕成功率再高,在工业场景里算下来的投入产出比也很难说服人。
VLA 模型是当前具身智能领域最受关注的技术路线之一。它把视觉感知、语言理解和动作生成整合进一套模型,让机器人能够依据语言指令完成复杂操作任务。但 VLA 模型有一个部署层面的老大难问题:推理太慢。
每个控制时刻,模型都要把一个庞大的视觉语言骨干网络跑一遍,计算量极大,导致延迟居高不下,实时控制频率难以保证。
这个问题并不新鲜,学界已经有不少人在尝试解决。今年 IJCAI 收录的一篇论文认为,现有的大多数方案都走偏了一步。AI科技评论(雷峰网公众号)联系到一作于闻达,围绕高效 VLA 方法进行交流。

论文原文:https://arxiv.org/abs/2601.19634

01
大家都在剪视觉,
但问题真的在这儿吗
现有的高效 VLA 方法,主流路线是在视觉侧做文章,剪掉“不重要”的视觉 token,跳过一些 Transformer 层,或者直接复用上一帧的计算结果。逻辑上听起来合理:视觉信息最占计算,减掉多余的视觉计算,自然就快了。
但这里有一个被忽视的矛盾。
在机械臂执行任务的过程中,视觉上的复杂程度和操作上需要的精度,并不总是同步的。机械臂接近目标的阶段,画面可能非常简单,但这时候恰好需要全力计算,因为精细的夹取动作容不得误差;反过来,大幅移动阶段画面变化激烈,但其实不需要太多计算资源。
换句话说,视觉复杂度不等于控制难度。以视觉信号来决定这一帧算多少,天然就抓错了对象。
AC²-VLA 一作于闻达告诉AI科技评论(雷峰网公众号),团队在调研文献时发现了这个矛盾,并意识到 VLA 模型闭环控制过程中,真正能反映当前时刻需要多少计算的,是机器人的动作状态,而不是视觉画面。

这个判断很直观,和 VLA 的逻辑也很吻合——V是视觉,L是语言,A是动作,既然VLA的最终产出是动作序列,那用动作来指导计算分配,才是真正贴近这类模型本质的做法。
基于这个出发点,他们提出了 AC²-VLA,全称是Action-Context-Aware Adaptive Computation for VLA models,即动作上下文感知的自适应计算框架。两个 AC,一个代表Action Context(动作上下文),一个代表Adaptive Computation(自适应计算),名字里藏着双关。

02
让动作来“拍板”
AC²-VLA 的框架主图展示了整体架构:视觉观测经过视觉编码器,语言指令经过 embedding,加上上一时刻的动作信息,三者共同构成一个动作先验条件向量,输入进一个统一的路由器(router)。这个 router 的输出,决定了当前时刻的计算策略。

具体来说,router控制三件事:
▎一、cognition caching(认知缓存复用)
如果当前动作状态比较稳定,router 认为可以尝试复用上一步的 VLM 骨干网络输出,就会发起复用请求。但这个请求不等于直接复用,还需要看缓存是否能命中,综合判断运动状态是否连续、视觉状态是否匹配。两个条件都满足,才会跳过整个 VLM 骨干的计算,直接将缓存中的特征向量送入 action head 生成动作序列。
▎二、token pruning(视觉token剪枝)
router 会为每个视觉 token 打分,判断它与当前操作阶段的相关程度。不相关的 token 被直接丢掉,缩短序列长度,减少计算量。这一步的依据同样来自动作上下文,机械臂正在接近夹取目标时,夹爪附近区域的 token 更重要;大范围移动时,这些区域的权重会相对下降。
▎三、layer skipping(层跳过)
并非每一层 Transformer 都需要每次执行。router 根据动作上下文判断当前需要多深的计算,对不需要的层直接跳过。有意思的是,不同任务阶段跳过的不一定是同样的层,同样保留28层,接触阶段和移动阶段调用的层序号可能完全不同,模型学会了在不同阶段调用最合适的网络深度。
这三个机制由同一个 router 统一调度,而不是各自用不同的启发式规则来判断。这也是 AC²-VLA 和此前工作最核心的区别之一,之前的方法即使有类似的机制,也往往相互独立,没有统一的训练过的路由来智能分配。

03
自蒸馏,一个很关键的训练设计
Router 的训练方式值得单独解释。
自然会有人想到,为什么不直接用任务成功率来监督 router 的学习?让它学会成功率高的时候可以少算,成功率低的时候多算?
问题在于,任务成功率是一个非常稀疏、非常离散的信号,而且只有完整跑完任务才能知道结果,没有办法实时反馈到每个时间步的计算决策上。更重要的是,如果以成功率为优化目标,框架的泛化性就会受损,换一个 backbone,成功率分布完全不同,原来学到的计算策略就失效了。
AC²-VLA 的解法是自蒸馏(self-distillation):用稠密策略(dense policy,即原始未稀疏化的模型)作为teacher,让稀疏化之后的 student 模型去模仿 teacher 的动作输出和骨干网络特征表示。
稠密模型已经在 Open X-Embodiment 数据集上训练过,对这些任务有一定的成功能力,用它作为 teacher,就能在尽量少算的约束下,让稀疏策略保持接近稠密策略的表现。
这个设计让 AC²-VLA 的高效框架有了可迁移性,换一个 VLA 骨干,只需要重新走一遍蒸馏流程,不需要为每个任务单独调参。

04
推理速度快了多少
AC²-VLA 基于 CogACT 构建,在 SIMPLER 仿真基准上进行了评测。SIMPLER 是当前具身智能领域常用的高保真仿真基准,旨在缩小真实世界与仿真的迁移差距。
在 Google Robot 的 Visual Matching 设定下,AC²-VLA 在四个任务上的平均成功率达到 76.8%,超过稠密基线 CogACT 的 74.8%,也超过了 RT-2-X 的 46.3%。其中 Drawer Opening 任务的成功率从 71.8% 提升到 80.6%,幅度最为明显。

效率数据更直观:计算量降低到原始模型的29.4%(FLOPs),实际推理速度提升 1.79 倍。这个 1.79 倍,在论文发表时是同类方法中的当前最优水平。

值得注意的是,这个加速并没有带来成功率的下降,反而略有提升。论文的解释是,被去掉的那部分计算大量对应于干扰项和冗余特征,移除它们反而让模型的决策更稳定。
FLOPs 降到 29.4% 而实际速度只提升 1.79 倍,两者之间的差距,于闻达解释为理论计算量与实际运行之间不可避免的开销:router 本身的运算、token 剪枝时的内存移动、缓存的查询和命中过程,这些都不完全体现在 FLOPs 里,但在实际运行时都会占用时间。因此,实际端到端加速才是更真实的参考指标。
消融实验进一步验证了三个组件各自的必要性。去掉缓存复用,成功率下降到 70.5%,速度也从 1.79 倍降到 1.66 倍;去掉层跳过,成功率跌至 67.4%;去掉 token 剪枝,速度降至 1.52 倍。三轴同时启用,才能达到最优的速度-精度平衡。

还有一个有趣的发现:在合适的缓存阈值设定下(τcache = 0.2),缓存复用不仅带来速度提升,还把成功率推到了 87.1%,超过稠密基线 12.3 个百分点。论文将这个意外收益归因于时间一致性——逐帧推理容易放大高频视觉噪声,导致动作抖动;而在动作上下文稳定时复用特征,相当于给决策过程加了一层平滑,反而让控制更稳。

05
这套框架的意义
从论文本身看,AC²-VLA 解决的是一个具体的工程问题:让 VLA 模型在不大幅牺牲成功率的前提下,快到可以用。
但它背后有一个更值得关注的思路转变——把动作从“模型输出”变成“模型计算的调度信号”。
之前的高效 VLA 工作,把动作当做需要被输出的结果;AC²-VLA 第一次尝试让动作反过来指导模型该看哪里、该想多少、哪些东西可以复用。于闻达提到,这个思路其实和 VLA 模型自身的逻辑一脉相承——既然动作是终点,那用动作上下文来规划通往终点的路径,顺理成章。
团队后续还有一篇工作(Actfovea,尚未发表)沿着相同的逻辑延伸,把动作作为先验信号,往安全性和鲁棒性的方向探索:如果动作序列和视觉状态之间出现了不一致,这种不一致本身就可以用来判断当前的观测和动作是否可信,以及是否需要回退重计算。
从落地的角度看,这类工作的现实意义更直接。当前 VLA 模型的部署难点,并不总是模型不够强,更多时候是模型太慢、太重,跑不起来。边缘设备没有足够的显存,机器人没有足够的算力,工厂里的机器臂不能等上三秒才动。把一个 7B 量级的 VLA 模型压缩到可以在端侧稳定运行,是让它从实验室走向车间的必要一步。
IJCAI 2026 要来了,你还在单打独斗?
为了方便大家抱团交流、互通会议消息,我们专门建了 IJCAI 2026 参会群!进群你会解锁这些「福利」?
会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
现场后援团:(会议期间专属开启):到了会场也不用慌——
路线导航:场馆分布、报告厅怎么走,群里随时问;
议题共读:热门 session、Keynote 现场探讨,错过也能追;
Poster 汇编:现场海报精华整理,一键收藏不遗漏;
约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。
? 进群传送门: 扫码进群或添加微信Qvv0909777,备注:IJCAI + 单位/学校+姓名+方向。

搞科研/搞技术,信息差很重要。
来,一起快人一步!


上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈

扫描上方二维码
或点击「阅读原文」关注专区。