Skip to main content
Aggregate 雷锋网 人工智能 27 Aug 2026 - 18:00

一台工业具身机器人,从理想到现实要经过哪些坑?

RSS 官方收录 · 可信分层展示

关键摘要

没有被客户“骂”过的公司,绝不会知道,从实验室到真实场景中间有多大的“鸿沟”。作者丨董子博 编辑丨林觉民 刚刚过去的 WRC,各家公司的展台只要涉及工业,躲不开的话题就是落地。…

  • 数百个机器人在展台上爬着楼梯、跳着舞蹈、打着拳击……种种的展示,只是为了告诉市场:自家机器人究竟有多好的性能;但在科大讯飞的展台上,一家叫聆…
  • 聆动通用对 AI科技评论表示,在实际的工作当中,LDB 正在逐渐逼近 80-90% 的工人人效,机器人在场馆里动作慢,主要还是受限于馆内人流…
  • “我们的展示在这样的展会上会比较吃亏,不像翻跟斗、打拳,”聆动通用的 CEO 季超对 AI科技评论表示,“这也正好也说明,我们是真的在做落地…

摘要引擎:抽取

正文提要

没有被客户“骂”过的公司,绝不会知道,从实验室到真实场景中间有多大的“鸿沟”。

    作者丨董子博

    编辑丨林觉民

                                                                                                       

刚刚过去的 WRC,各家公司的展台只要涉及工业,躲不开的话题就是落地。

数百个机器人在展台上爬着楼梯、跳着舞蹈、打着拳击……种种的展示,只是为了告诉市场:自家机器人究竟有多好的性能;

但在科大讯飞的展台上,一家叫聆动通用的公司虽不算起眼,两台机器人按部就班地分拣着快递包裹,受制于现场因素,动作算不上伶俐,但准确率、抗干扰做得都很不错。

聆动通用对 AI科技评论表示,在实际的工作当中,LDB 正在逐渐逼近 80-90% 的工人人效,机器人在场馆里动作慢,主要还是受限于馆内人流拥挤的环境——全速运转或许会有安全隐患。

我们的展示在这样的展会上会比较吃亏,不像翻跟斗、打拳,聆动通用的 CEO 季超对 AI科技评论表示,这也正好也说明,我们是真的在做落地的事儿。

在具身智能赛道,“落地”是一个被严重通胀的词汇。进工厂拍条视频叫落地,签个意向协议叫落地,甚至把机器人拉到展厅里走两步,PPT上也能写场景验证的落地”——但真正的落地只有一个标准:客户愿不愿意在验收单上签字,以及签完字后,会不会因为无法实际落地干活,而导致不能真正买单验收。

但当了解了更多聆动通用背后的故事之后,AI科技评论却发现,在工业落地的层面,他们走得相当果决。

两个核心指标——商业有闭环批量可复制——是他们心中最关键的落地能力。

当然,这两句话,放到每一个目标工业的具身公司,都可以适用;但真的走进工厂,实验室里的“Simulation”(模拟)和实际场景的“Reality”(现实)却有巨大的鸿沟。

怎么跨越这个鸿沟,聆动通用选择的,是一条没有捷径“难而正确的道路”。

图片

01


商业可闭环:

好的落地,是被客户“骂”出来的

对于聆动通用 CEO 季超来说,在学校里,研究 Robot learning(机器人学习)的他经历过自动驾驶的周期;中科大毕业后,进入科大讯飞的他,又遇上了 AI 大模型的一波周期。

但学术科班出身的季超,却在具身的行业里,主动选择了一条最脚踏实地的路。

见过一个行业的大起大落,季超组建了一个以产业化实力见长的年轻团队,依托科大讯飞的深度孵化,建立了聆动通用——意在用物理 AI 的技术来服务产业,从“L2”级别的能力做起,沿途下蛋地找到应用场景、建立数据飞轮,进而用商业化的成绩反哺研发的投入。

要做商业化,就必须找到最合适的场景。

对于具身智能来说,劳动密集型的物流、汽车、装配产业自然是落地空间更大的场景——它不像家庭场景那样无序,天然为技术迭代提供了缓冲带;同时,在自动化设备和产线已经相对成熟的今天,柔性泛化的智能化能力仍然欠缺。

在聆动通用看来,物流场景是个更好的起点,在一个更确定的环境下,公司可以先建立起自己的技术和商业化基本盘,进而支撑自己向着下一个高质量 B段场景的跃迁。

实际场景里,客户看的最终只有 ROI,只要机器人能够在场景里实际产生价值,客户就会买单。但让具身机器人在场景里实际可用,却远没有想象的那么简单。

聆动通用吃过亏——团队运行之初,当他们拿着自己设计的产品走进客户物流分拣的产线,实际的效果却让他们都傻了眼。

掉链子的是模型。在实验室里,聆动通用的模型可以做相当精准的识别和动作规划。但到了产线,模型却跑不起来了。

季超一眼就看出了问题:例如在实验室,传送带的速度只会开到 0.5-0.7m/s;但到了现场,传送带的速度却达到了 1.5m/s——速度翻了一两倍,模型的推理速度就完全跟不上了。

同时,机器人的也出现了问题。事实上,聆动通用是国内最早一批使用灵巧手的具身公司之一——灵巧手在高频操作场景下的寿命问题,他们再清楚不过。

于是,聆动通用自己设计了一个吸盘和夹爪结合的操控方案,在国内也是相当先锋的方案。但真实的工况,远比理想的情况复杂吸盘进气量小了,重包裹又吸不起来;进气量大了,又容易把轻软的包裹吸破,还得赔偿损失。

演示失利,公司从客户这里接收到了巨大的压力。

于是在半年里,团队直接搬进了生产现场,把模型架构、数据 Infra、末端夹持全部重构了一遍,这才跨过了这道坎,有了聆动通用后来的 LDB 型工业具身机器人。

在模型层,聆动通用联合科大讯飞研究院了推出了统一多模态具身大模型 iFLYTEK-Embodied-Omni,主要就是解决误差叠加、时序控制不足的问题,用VLM VGM 来理解指令、预判环境、规划任务;再用AGM 动作模型来做好运控等底层操作。

这套结合了图像、视频、文本、动作表征的模型架构,能够在到世界后,同步预测世界、生成动作,在LIBERO-PlusRoboTwin 2.0 等国际主流仿真基准测试中,都拿到了不错的成绩;也在实际落地的物流场景当中,实现了不错的泛化能力和鲁棒表现。

在本体层,聆动通用也自研了工规级的通用具身机器人 LDB01,凭借着出色的效率,拿到了国内首张工业级具身机器人 CR 认证,随后又获得了欧盟的 CE-MD 工业机械安全认证,在国内和海外范围内,拿到了可以实际落地的强认可。

LDB 机器人能让客户算出正 ROI,核心在于两阶段的价值递进。

第一阶段是直接替代人工的账。一个物流分拣工人两年的综合成本(工资、社保、福利等叠加)约等效于购买一台LDB稳定作业运行两年(聆动机器人平均无故障工作时长不低于7000小时)。简单算下来,工人两年的工资就能覆盖一台机器人好几年的使用成本,两年后就基本是纯收益在即将到来的老龄化时代,可以想见能长程不间断干活的机器人是一种刚需。

更关键的是,LDB 支持 OTA 远程升级,模型持续迭代、效率越用越高——客户"买了之后越用越强",达到最低要求后每次升级都是净赚,这笔账只会越来越划算。

第二阶段是生产体系重构的账。当机器人在产线上稳定运行后,客户就会开始思考更深层的问题:原有的生产流程是不是围绕""设计的?

引入具身智能后,整条产线的布局、节拍、流程都可以重新设计。LDB不再只是单纯的替代单一工位的“人”,而是嵌合到全新的生产流程再造中,从整个系统的大账上算降本增效——这是超越单台 ROI 的更大价值。

从市场空间看,一个物流中转站可部署数十台 LDB,全国这样的转运中心有上千个,批量部署后边际成本持续递减,客户的 ROI 模型也会随着规模扩大而进一步优化。

图片

02


批量可复制:

量产和运营都是难题

商业化闭环形成了,下一步就是把成功的闭环进行批量的复制——然而,并非所有好的闭环,都能够被复制。

LDB 的能力已经在物流场景得到验证,要完成成功经验的批量复制,量产则是万里长征第二步

量产很难,但量产不难:量产的难,难在机器人的本体架构设计、难在供应链的管理和价格控制——解决了这些问题,扩产就不是难题。

LDB 的设计主打的就是实用主义

LDB的设计,比起机器人,更像一台智驾汽车。从模块到系统,从硬件到软件,这台机器人从诞生第一天起,就没有走传统机器人的老路——它的每一寸设计,都严格按照汽车工业标准来打磨。

通信总线,聆动通用也全盘照搬自动驾驶方案。传统机器人那套老旧的方案,几乎被聆动通用彻底抛弃,取而代之的是在百万辆汽车上验证过的高可靠、高实时总线架构。

算力,是 LDB 最硬核的底牌。数千 TOPS 端侧算力,同样是严格车规级配置——这不是为了跑分,而是为了让具身大模型直接在机器人身体里跑起来。不依赖云端,不等网络延迟,感知、决策、执行全在端侧毫秒级完成,这才是工业场景的刚需。

LDB整机设计,严格遵循汽车功能安全标准,哲学只有两个字:极简。

极简到什么程度?打开 LDB 的机身,几乎找不到一根 USB 线束——所有走线规整有序,风冷散热方案经过精密调校,让续航与功耗达到最优平衡。

而这一切的成果是:LDB 单台 BOM 成本,可以控制在一个相当低的范围内。

LDB 的设计足够精致,要让机器人能够做到更好的可复制性,聆动通用又上了一道保险软硬一体,全栈自控。

具身大模型天生对硬件有苛刻的要求——传感器的延迟、执行器的精度、算力的吞吐、总线的带宽,每一个参数都直接决定模型能不能跑、跑得好不好。但在行业里,让模型团队和硬件供应商坐下来"握手"适配,几乎是不可能的任务沟通成本巨大,迭代周期漫长,出了问题互相甩锅,最后谁都做不好。

在工业底座这块,聆动的边界划得非常清晰:从大脑到小脑到本体,全链路自主可控。

而科大讯飞,则在更上层的公共大平台基座上提供支撑——通用大模型能力、语音交互技术、供应链资源,这些是讯飞的主场。聆动专注工业底座的软硬一体,讯飞夯实公共AI 基座,双方各司其职,又深度协同。

要知道,聆动通用更强调全栈自控,而不仅仅是全栈自研供应商能满足的标准件,聆动通用不去重复造轮子;但与模型强耦合、直接决定产品体验的核心组件,必须自己做。

目前所有具身智能公司的机器人量产,本质上都还靠人工组装,聆动也不例外。首批良率 90% 出头——相比于汽车行业 95% 以上的一次良率,还有差距,但在机器人行业已经是相当扎实的起点。

2026 年全年,聆动通用的预计交付量大概在 200 左右,公司当前正处于扩产阶段。生产流程已经标准化,配有专门的品质工程师驻场把控质量 —— 这背后,科大讯飞成熟的供应链体系提供了重要支撑。

更关键的是,聆动有自己的工厂,具备自给自足的产能能力,所以对聆动来说,产能从来不是瓶颈,需求起来了,扩产只是时间问题。

量产只是"硬骨头",运营才是真正的"深水"

当同行还在为"能不能造出真干活的机器人"焦虑时,聆动通用已经在思考一个更残酷的问题:造出来之后,怎么批量部署?运营成本怎么压?怎么标准化?怎么降低每一个新场地的部署和交付成本?这些才是单点商业化之后,走向批量商业化的真正门槛。

今年下半年到明年,聆动的核心任务就是啃下这块硬骨头:在完成多机集群部署验证之后,全力推进标准化,实现运营成本的边际递减。

标准化的核心,是 FDE现场部署工程师,十几人的团队,每一个都"贵得离谱"——得同时懂技术、懂业务、还能跟客户顺畅沟通,这种人才在市场上凤毛麟角。

实际运营中遇到问题,FDE 会直接驻场,用 AI 编程快速出原型:客户当天提需求,第二天就能跑通一个可交互的原型帮他确认。但 AI 原型不能直接上线,客户侧的工程团队会把确认后的效果底层重构成工业级稳定代码——这是聆动摸索出的高效交付模式。

运营的最终目标,是和客户一起"冻结"标准化解决方案。需求一旦冻结,后面的部署就可以复制,而只有复制,才有利润。聆动把这条路拆成四个阶段:

0→1,形成标准部署流程和现场培训体系;

1→2,把定制化和微调成本压到最低;

2→3,验证每一个单点的交付模型是否留有足够利润;

3→100,验证利润是否可复制、边际成本是否真的在递减。

如果说 LDB 是在产线上"干活的手",那 LDT 就是"采集数据的眼"。两者构型相同,共同构成聆动软硬一体的全套解决方案——LDT 的第一产品定义,就是高精度后训练数据采集

它和 LDB 一起部署在产线上协同工作,但性能更强——端侧算力是 LDB  10 倍以上,支持 10B 以下小模型的推理与部署,采集回来的数据可直接用于训练。同时支持二次开发,与中科大、武大、清华、哈工大等高校深度合作。

LDT采集的数据反哺LDBLDB 产生更多数据——这就是聆动的数据飞轮。

图片

03


  结语:

没有捷径,才是最大的护城河

在具身智能落地的竞逐中,聆动通用选择了一条最也最熬人的路——到客户现场去,花半年时间重构整个模型架构;一个场地一个场地地驻场,把运营经验熬成标准化流程;一台机器人一台机器人地采集数据,把真机数据熬成模型的泛化能力。

LDB 在物流行业正在验证自己的价值,下一步,汽车、3C 都是聆动通用目标进入的行业,在更大的舞台上用更强的落地能力,给客户带来更大的效率提升。

自今年下半年起,聆动的目标是从"能干活""能复制"。季超知道,这才是真正的硬仗——因为工厂与工厂之间的差异,比实验室与工厂之间的差异还要大。

这些事,没有任何捷径可走。而恰恰是这些 “没有捷径” 的事,构成了真正的护城河。

谈到聆动通用在做的事情,季超对 AI科技评论说道:在这条没有捷径的路上,如果能走得更坚决,当别人想超越你的时候,你已经跑得很远了。

雷峰网

打开官方原文 站点原文页 可信分区 本信源更多 今日简报 分享图 RSS 稍后再看列表 官媒栏目