微信内可能无法直接打开本站。请点右上角 ··· → 在浏览器打开,或复制链接。
突破具身智能物理死角:IJCAI 2026 具身智能泛化与控制突破
RSS 官方收录 · 可信分层展示
关键摘要
告别理想仿真,中国学术团队用物理工程方案回应落地挑战。作者丨张璐 编辑丨岑峰 过去一年多里,具身智能似乎按下了快进键。从 Physical Intelligence 发布的π₀到开源社区追捧的OpenVLA,VLA大模型一路高歌猛进。…
- 在各种标准基准测试和精心搭建的实验室 Demo 中,机械臂叠衣服、拿取物品流畅得宛如人类,动辄刷出 90% 甚至 95% 以上的成功率。
- 然而,当全行业都在欢呼“机器人的 GPT 时刻”到来时,前沿学术界与产业界却爆发了一场剧烈的反思:这些动辄数十亿参数的具身大模型,真的学会“…
- 在主流学术视角中,VLA 大模型像是给机器人装上了具备常识与规划能力的“大脑”。
摘要引擎:抽取
正文提要

作者丨张璐
编辑丨岑峰
过去一年多里,具身智能似乎按下了快进键。
从 Physical Intelligence 发布的π₀到开源社区追捧的OpenVLA,VLA大模型一路高歌猛进。在各种标准基准测试和精心搭建的实验室 Demo 中,机械臂叠衣服、拿取物品流畅得宛如人类,动辄刷出 90% 甚至 95% 以上的成功率。
然而,当全行业都在欢呼“机器人的 GPT 时刻”到来时,前沿学术界与产业界却爆发了一场剧烈的反思:这些动辄数十亿参数的具身大模型,真的学会“举一反三”了吗?还是在“死记硬背”?
在主流学术视角中,VLA 大模型像是给机器人装上了具备常识与规划能力的“大脑”。但要让机械体真正干好精细活,仅有一个聪明的大脑远远不够。
最新实验数据表明,面对物品位置的随机挪动或新指令组合时,纯端到端大模型往往会受到“空间过拟合”的约束,末端执行成功率会出现剧烈衰减。
这恰恰说明:具身智能要真正走出实验室,不仅需要大模型提供常识和高层决策,更需要扎实的工程技术去打造精准、稳健的“小脑”。
下面雷峰网盘点入选 IJCAI 2026 的 6 项中国团队成果。它们并非要替代大模型,而是从空间泛化、盲区感知到极端控制,为具身智能补齐了通往真实物理世界最关键的拼图。

01
解决死记硬背,
大模型如何搞定未见场景
具身智能的核心瓶颈之一在于真正的泛化能力。目前的VLA动辄拥有数十亿参数,但在面对没有见过的指令组合或场景变化时,表现往往大打折扣。
▎泛化成功率跌破 21%:不重训模型,如何把成功率拉回 83%
论文:《VLAs Are Confined yet Capable of Generalizing to Novel Tasks》
作者:李全义(论文独立作者,一路从北邮本科、爱丁堡硕士深造至新加坡国立大学 CLeaR Lab 博士,现任 Oxa 高级应用科学家)

论文链接:https://arxiv.org/pdf/2505.03500v5
假设你给机器人下达了一道指令:“把奶酪放进柜子”。如果在训练数据里,这块奶酪总是摆在桌子左侧,那么当你在现实中把奶酪挪到桌子右侧时,会发生什么?
在李全义博士最新的研究中,发生了令人啼笑皆非的一幕:主流 VLA 大模型依然会机械地伸向桌子左侧。

模型根本没有理解什么是“奶酪”,它只是把词汇与训练集里的固定物理坐标进行了强行绑定。 无论是π₀、OpenVLA 还是 UniVLA,虽然它们在标准测试集里能刷出 95% 以上的超高成功率,但李全义博士专门构建了 20 个外推新任务的 libero-ood 基准。
在这个不按套路出牌的考场上,主流 VLA 的成功率瞬间断崖式跌落到了 21% 以下(OpenVLA 仅 1%,π₀-fast 为 17%,UniVLA 为 21%)。原因是:大模型在决策时根本不关注物体本身,只盯着机械臂末端与终点坐标。

但这项研究最精彩的部分在于“反转”。李全义博士通过机制可解释性方法,从大模型内部提炼出了代表任务语义的“文本隐变量”。在模型残差流中实施“文本隐变量插值(TLI)”后,在完全不重新训练模型的前提下,直接将 π₀ 在外推新任务上的成功率从 9%提升到了 83%!
这项由中国年轻学者完成的独立研究,不仅用严谨的数据证实了现有的端到端微调确实落入了死记硬背的陷阱,更从底层表征上证明了大模型内部早已蕴含了可组合的通用泛化潜能,只是过往粗暴的端到端训练并没有找到唤醒它的正确钥匙。
▎微调 0.63% 参数:4 小时练完视觉大模型,嵌入式芯片 63ms 响应
论文:《RepSAM: Bridging Foundation Models to Robotic Vision via Representation-Guided Adaptation》
作者:Chu Wenhui(德克萨斯 A&M 大学)

论文链接:https://arxiv.org/pdf/2605.25495
我们先来看两组极其悬殊的对比数据:
传统全量微调“分割一切”大模型 SAM(ViT-H):需要训练 6.32 亿参数,耗时 384 个 GPU 小时。
RepSAM 的适配方案:仅微调 400 万参数,单卡 A100 训练 4 小时。
参数量缩减了 158 倍,训练速度提升了 96 倍,感知效果却达到了全量微调 97.9% 的水准。它是怎么做到的?
Chu Wenhui 并没有盲目地对整个大模型进行“一刀切”式微调。他利用中心核对齐(CKA)理论对 SAM 的 32 层 Transformer 网络进行扫描后,发现了大模型内脏里的表征漂移规律:
浅层网络(L1-10)低阶特征的领域差异极其剧烈(CKA < 0.5),必须分配高容量适配(Rank 16);
中层网络(L11-22)处于中等特征过渡区(Rank 8);
深层网络(L23-32)的高阶语义表征则高度通用(CKA > 0.7),只需极低容量适配(Rank 4)。

RepSAM架构图
靠着按需低秩适配,RepSAM 在面对透明玻璃杯、严重遮挡堆叠零件等传统视觉大模型经常失明的场景时,展现出了极其惊艳的感知力。
在 ClearGrasp 透明物体分割任务上,mIoU 从 SAM 零样本的 34.7% 暴涨至 90.1%;在真实的 PyBullet 抓取物理仿真中,抓取成功率高达 94.4%,碰撞率降低了 8.8%。

但在真实的工业抓取场景中,光有高精度远远不够。算力开销与实时响应时延,才是技术能否走出实验室的关键。
嵌入式机械臂与边缘控制器算力极其宝贵,根本无法承载动辄全量重训的重型视觉网络。而RepSAM 真正硬核的地方,恰恰在于它在保持高精度的同时,在嵌入式设备 Jetson AGX Orin 上跑出了低至 63ms (15.8 FPS) 的响应时延。
这种对计算效率与表征规律的极致压榨,真正解开了工业级具身视觉在边端部署上的时延枷锁。

02
指令抽象、视线遮挡,
如何实现厘米级精准交互
进入真实场景后,机器人将面临两大感知杀手:一是人类给出的自然语言指令往往高度抽象,在连续空间漫游时极易迷路;二是当机械臂接近物体时,机械臂自身或周围障碍物会完全挡住摄像头,形成物理上的视觉盲区。
▎连续空间导航:提取自然语言地标,陌生环境成功率提升 7%
论文:《FILD-Nav: Vision-and-Language Navigation with Instruction Landmark Features in Continuous Environments》
团队:Chuangye Hu, Lulu Liu, Huaiwei Si, Yawen Zhao, Nan Ding(中国学者团队)
英伟达 CEO 黄仁勋曾在 GTC 大会上对具身导航做过一个极其深刻的断言:
未来的具身导航绝非简单的几何建图与避障,而是语义理解与物理空间地理信息的深度交融。
当机器人从桌面搬运走向更大范围的真实连续空间时,这一断言在真实场景中显得尤为贴切。“绕过前面的木质办公桌,直走到厨房,在水壶旁停下。”人类听到这样的指令时,大脑会在移动过程中,不断用眼睛去校验“木质办公桌”和“水壶”这两个核心参照物。
但在连续环境下的视觉-语言导航任务里,现有算法在航点预测(Waypoint Prediction)时往往缺乏高阶语义引导,在跨模态规划中也缺少显式的“语言-地标”对齐。这导致机器人无法精准匹配指令里的物理实体,在跨长周期导航里走着走着就迷失了目标。
中国学者团队提出的 FILD-Nav 框架,正好给出了呼应这一行业趋势的硬核答卷。算法能自动从复杂的自然语言指令中提炼出与任务强相关的“地标特征(Instruction Landmark Features)”,并将地标语义双向注入到导航的核心环路中:
地标引导的航点预测:将地标语义融入航点生成,大幅提升预测航点与真实物理地标的相关性;
地标增强的拓扑规划:在跨模态规划中引入地标语义校验,使机器人具备了更稳健的长周期导航能力。
在权威基准数据集 VLN-CE 的广泛测试中,FILD-Nav 的导航成功率(SR)提升了 2%,路径长度加权成功率(SPL)提升了 3%。特别是在未曾见过的全新陌生环境里,其 Oracle 成功率(OSR)大幅提升了 7%。
这种赋予机器人边走边用语言符号校验物理地标的高级认知能力,正是将黄仁勋所描绘的“语义与空间深度交融”落地为现实,为服务机器人走出实验室、迈入结构复杂的商场、医院与家庭场景打通了关键路线。
▎最后一厘米视觉盲区:无需相机参与,150 个真实物体抓取率 97.3%
论文:《PECHC: Robust Tactile Grasping Stabilization in Vision-Denied Peripersonal Space》
团队:中国科学技术大学 董二宝教授团队
无论是 Meta 开源的 Digit 触觉感知平台,还是各类灵巧手在手指末端加装多轴触觉传感器,都指向了一个非常现实的行业共识:要想让机器人学会做精细活,光靠眼睛是远远不够的。
触觉之所以被推到台前,根本原因在于视觉在接近目标“最后一厘米”时的天然盲区。
当机械臂手眼协同深入狭窄空间或接近目标时,相机视线会被夹爪和机械臂自身完全遮挡。加上相机标定误差,视觉信息在最后关头往往极其不可靠。没了视觉,传统的视物抓取算法失去视觉参照,极其容易产生碰撞失误,或者因无法感知接触力而把蛋挞、玻璃杯等易碎品捏碎。
中国科学技术大学董二宝教授团队提出的 PECHC(物理演化级联约束与人类纠偏)算法,选择在视觉彻底失灵的近身盲区里,把控制主导权毫无保留地交给触觉。
为了彻底隔离触觉在多指协同中的独立贡献,团队采用解耦控制策略,将灵巧手工作空间内的抓握稳定设为一个无需视觉参与的“安全防御反射(Fail-Safe Reflex)”:
混合纠偏模仿学习 (HCIL):建立由失败触发的人机纠偏机制,仅需极稀疏的人类专家纠偏即可高效弥合模型差距;
级联约束调度 (CCS):施加物理上合理的行为约束(几何接近、力封闭与动态稳定性),一举弥合几何拓扑差距;
时序异构蒸馏 (THED):从历史触觉序列中进行隐式系统识别,精准弥合真实物理动力学差距。
在涵盖 150 个真实物体(Visual Dexterity 数据集)的完全自主测试中,PECHC 展现出极高的鲁棒性:实现了 97.3% 的真实机器人抓取成功率!
整个测试过程中,仅需 1 个物体进行一次性 HCIL 校准,其余 149 个全新物体在没有任何干预的情况下全部轻松搞定。相比传统的 Sim-to-Real 强化学习 Baseline(带域随机化的 Vanilla PPO),PECHC 性能大幅提升了 42.8%,并且在抓取易碎物品时展现出了类似人类手掌的细腻调力能力。
团队用实打实的 97.3% 真实成功率证明了:当视觉退场后,高阶触觉感知才是让机器人安全触达物理世界的最终屏障,也展现了中国学术机构在灵巧手触觉控制领域的突破。

03
极端控制:面对强风暗流,
如何防止强化学习算法崩盘
当具身智能从理想的室内实验室走向户外、高空或海洋,算法面临的威胁不再只是简单的视觉遮挡或空间位置变化,而是充满了高度随机性与非线性的真实物理世界扰动。
在海浪冲刷、复杂洋流、强阵风以及高异构传感器噪声的夹击下,缺乏鲁棒防护的传统算法极其容易发生价值函数崩溃,甚至引发致命的碰撞与坠毁。如何让机器人在极端环境中保持稳健控制?中国学者们在控制算法的底层数学设计上交出了一份满意的答卷。
▎极端海况抗扰:分布鲁棒替换反向传播梯度,碰撞率下降 12.28%
论文:《Perturbation-mitigated USV Navigation with Distributionally Robust Reinforcement Learning》
团队:香港科技大学(广州)熊辉教授团队
强化学习教父 Rich Sutton 曾提出过著名的“苦涩的教训(The Bitter Lesson)”,认为纯粹基于数据和算力的通用算法,终将战胜人类精心设计的物理规则。
然而,当算法从理想的计算机仿真走到残酷的物理世界时,纯数据驱动的脆性便暴露无遗。以无人水面艇为例,当它行驶在充满了未知暗流、隐蔽礁石以及恶劣天气的真实海面上时,传感器观测噪音会随海况剧烈波动。这种高度异构且非平稳的观测干扰,极其容易导致传统强化学习算法的价值函数彻底崩溃,引发致命的碰撞与迷航。
香港科技大学(广州)熊辉教授团队提出的 DRIQN(分布鲁棒隐式分位数网络)算法,选择用极其优雅的数学手段,给纯数据驱动的强化学习穿上了一套“防护罩”。

论文链接:https://arxiv.org/pdf/2512.00030
面对海量且复杂的噪声干扰,团队没有采用增加复杂辅助模块的“重型架构”,而是做出了两项关键突破:
回放池显式子组建模:将经验回放池中的转移数据按噪声模式划分为J个同质子组,专门对异构噪声与最坏工况进行显式建模,巧妙地将原本计算极其复杂的点级 DRO 优化,转化为高效的子组级损失优化;
轻量化“梯度替代”机制:利用分布鲁棒优化(DRO)求解出的对偶二次规划,直接替换神经网络最后一层的反向传播梯度。这样既完整保留了深度网络高阶特征表达的优势,又让算法天生具备了抵御最坏工况的鲁棒性。
在叠加了 4 个水流涡流、6 个随机礁石障碍物以及高强度传感器噪声的模拟极端海况下,DRIQN 展现出了极其硬核的抗扰稳定性。相比顶级基线模型,它不仅将导航成功率提升了 13.51%、碰撞率降低了 12.28%,还在成功航次中同时实现了 35.46% 的省时与 27.99% 的节能。
即便面对传感器突变与数据丢失交织的复合故障,DRIQN 依然以 58% 的全场最高成功率和最低超时率跑赢了所有对手,做到了安全性、能效与容错力的全面兼容。

熊辉教授团队的这项成果证明了,纯数据驱动的 RL 在复杂的物理世界里绝不是万能的。通过在梯度更新层面无缝融入分布鲁棒性,为无人艇、无人机乃至各类工业巡检机器人如何在极端物理扰动下保持可靠决策,提供了一份硬核的工业级答卷。
▎突发强侧风控制:空气动力学与强化学习混合,毫秒级估计风场
论文:《Disturbance-Aware Hybrid Learning for Robust and Adaptive UAV Flight in Extreme Winds》
团队:重庆大学古富强团队
在大地之上的高空,无论是高压输电线的野外巡检,还是狭窄山谷里的搜救探险,突如其来的强阵风始终是无人机最致命的噩梦。
传统 PID 或模型预测控制(MPC)在面对非线性强风时响应滞后;而纯深度学习控制在面对未曾见过的风场时极易产生过拟合,一旦遇到突发侧风,无人机极易失控翻机坠毁。
重庆大学古富强团队提出的扰动感知混合学习(Disturbance-Aware Hybrid Learning)架构,切中了极端风况自适应控制的核心痛点。
算法构建了一个实时风场扰动感知模块,能像飞鸟的羽毛感知气流一样,毫秒级实时估计作用在无人机机体上的非线性气流扰动特征。随后,它将传统空气动力学物理模型与数据驱动的强化学习策略进行动态混合(Hybrid Learning),根据实时感知到的扰动强度毫秒级调整控制权重,实现了极端风况下的平稳悬停与高精度轨迹跟踪。
这项研究,切中了低空经济发展中最核心的安全刚需,正是无人机从“摄影工具”跃迁为“全天候工业级生产力工具”的关键技术桥梁。

04
结语:在 Scaling Law 的信仰之外,
寻找物理世界的硬解
梳理完这 6 篇研究,最触动人的其实是一种路线的分野。
当 Physical Intelligence 和 Figure 这些硅谷明星团队倾尽算力和数据去押注VLA 大模型的 Scaling Law时,他们试图重演大语言模型的奇迹:相信只要模型参数足够大、视频喂得足够多,通用的物理控制能力就会自然“涌现”。
但这套逻辑在真实的物理世界里,正频频碰壁。真实场景充斥着摩擦力、相机盲区、突发的阵风和传感器噪声。面对这些毫无规律可言的物理死角,端到端黑盒模型的泛化表现往往比预想中脆弱得多。
相比之下,这 6 篇来自中国学者和科研机构的成果,展现出一条极其清晰的“物理工程主义”路线。
大家不再盲目追逐参数规模,而是直接拆解大模型的内脏,用 CKA 理论摸清表征漂移,拿 0.63% 的参数量就把视觉大模型嵌进边缘芯片。在镜头完全失灵的最后关头,不靠算法去凭空盲猜,而是直接把控制权交给毫秒级响应的触觉反射;面对海浪和强风的袭扰,则从数学底层入手,用分布鲁棒优化直接给强化学习的梯度更新安上防护罩。
具身智能不能只停留在展台炫技。真正的产业落地,绝不会诞生在无限堆叠数据的实验室里,而属于那些能精算算力成本、硬刚真实物理环境各种复杂扰动的方案。
IJCAI 2026 要来了,你还在单打独斗?
为了方便大家抱团交流、互通会议消息,我们专门建了 IJCAI 2026 参会群!进群你会解锁这些「福利」?
会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
现场后援团:(会议期间专属开启):到了会场也不用慌——
路线导航:场馆分布、报告厅怎么走,群里随时问;
议题共读:热门 session、Keynote 现场探讨,错过也能追;
Poster 汇编:现场海报精华整理,一键收藏不遗漏;
约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。
? 进群传送门: 扫码进群或添加微信Qvv0909777,备注:IJCAI + 单位/学校+姓名+方向。

搞科研/搞技术,信息差很重要。
来,一起快人一步!

上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈

扫描上方二维码
或点击「阅读原文」关注专区。