Skip to main content
Aggregate 雷锋网 人工智能 31 Aug 2026 - 19:30

8 位 AI 创业者谈世界模型:生成一切之后,还差一点常识|WRC 2026

RSS 官方收录 · 可信分层展示

关键摘要

会生成未来,不等于理解世界。作者丨吴思梦 编辑丨岑 峰 2026世界机器人大会的最后一天,一场题为“世界模型到服务人类的现实距离”的论坛对话,将八位分别来自模型、数据、本体、仿真各赛道的创业者拉到了同一张桌子上。…

  • 这场对话由刚刚获聘中国电子学会世界模型专委会主任委员的之江实验室主任、阿里云创始人王坚主持。
  • 八位对话嘉宾——大晓机器人董事长、商汤科技联合创始人王晓刚,奥比中光创始人、董事长黄源浩,无界动力创始人、CEO张玉峰,跨维智能创始人、CE…
  • 尽管大家都在一个大领域里,但每个人对时代和技术的经历各不相同。

摘要引擎:抽取

正文提要

会生成未来,不等于理解世界。

    作者丨吴思梦  

    编辑丨岑   峰

                                                                                                       

2026世界机器人大会的最后一天,一场题为“世界模型到服务人类的现实距离”的论坛对话,将八位分别来自模型、数据、本体、仿真各赛道的创业者拉到了同一张桌子上。

这场对话由刚刚获聘中国电子学会世界模型专委会主任委员的之江实验室主任、阿里云创始人王坚主持。八位对话嘉宾——大晓机器人董事长、商汤科技联合创始人王晓刚,奥比中光创始人、董事长黄源浩,无界动力创始人、CEO张玉峰,跨维智能创始人、CEO贾奎,智澄AI创始人、CEO胡鲁辉,飞渡科技联合创始人、总经理宋彬,蚂蚁灵波科技首席科学家沈宇军,极佳视界联合创始人、首席科学家朱政,均为该专委会委员。

尽管大家都在一个大领域里,但每个人对时代和技术的经历各不相同。王坚请八位嘉宾依次从自身经历出发,畅谈:你们认识的世界模型,到底是什么?

一个小时的讨论围绕三个议题层层递进,从“世界模型到底是什么”开始,到“高质量数据会不会成为不可逾越的成本障碍”结束。有人把它称作生成式AI“皇冠上的明珠”,有人自嘲是“卖铲子的人”,有人把底座能力比作“九年义务教育”,还有人追问属于具身智能的“DeepSeek时刻”何时到来。

但真正让这场对话显出重量的,是那些在比喻之外逐渐浮出的判断:

世界模型不能只停留在“生成得像”,而要跨过模仿学习,去理解物理世界的底层逻辑;数据虽然稀缺,但模型一旦具备真正的理解力,数据依赖或许会急剧下降;落地的路径也并非一步跨进家庭,而是先到工业里练技能,再到商业场景里练泛化,最后才敢叩响家门。更棘手的约束来自工程本身,边缘算力有限,功耗不能无限膨胀,安全机制和熔断设计必须跟上。

八个人从不同赛道出发,最终都指向同一个问题:从生成到理解,中间还差什么?而从垂类到通用,或许才是这场漫长赌局的终局。

以下为本次论坛对话的精编稿,雷峰网基于现场录音转写稿进行了不改原意的编辑整理:

图片

01


议题一:

世界模型,到底不一样在哪?

王坚(主持人,之江实验室主任、阿里云创始人):最近几年世界模型这个词很热。诸位是不是能够从自身的经历,谈一谈你们所认识的世界模型,跟现在其他讲的模型有什么不一样的地方?当前有哪些非常有意思的技术路线?

王晓刚(大晓机器人董事长、商汤科技联合创始人):我们从2024年10月发布了“开悟”世界模型1.0。过去几年,我们认为世界模型的应用经历了几个阶段。第一阶段,世界模型主要用来做数据增强——举一反三、反一百,通过世界模型生成各式各样的数据作为训练数据的补充。第二阶段,世界模型可以作为模拟仿真器,模拟动态世界的动态变化,比如端到端自动驾驶,就在世界模型里通过强化学习不断自身演进进化。第三阶段,就是今天大家更加期待的——World Action Model,把世界模型直接部署到机器人终端的大脑,让它实时驱动本体。

世界模型相比以前的VLA模型,最大的特点是能够对世界的未来状态进行生成和预测。VLA还属于模仿学习,针对特定任务、特定硬件本体,很难期待它做出智能的涌现。它擅长的是静态场景,比如抓取一瓶水,环境不发生变化时预测运动轨迹。但今天的世界模型假设世界在交互过程中不断演化变化,我们一边执行动作,一边对各种可能性、平行空间里未来可能产生的后果做出推理和演绎。所以世界模型要具备理解、生成、预测一体化:一个模型,能够对复杂任务进行拆解,判断执行效果是成功还是失败,完成度是多少;生成对未来世界状态的演绎;预测并控制真机本体——三种能力共享特征。

黄源浩(奥比中光科技集团股份有限公司创始人、董事长):讲世界模型,一般都是跟大语言模型相对的。2022年底GPT出来之后,大家都知道大语言模型效果特别好,过了一阵,逐步有人讲空间智能、讲世界模型。大语言模型只能语音交互,而世界模型能够让机器人具身智能真正帮人类干活,解放的是80亿人类的劳动力。原来的GPT只能诗和远方,不能实地干活。

世界模型是解决这个问题的。我们是做世界模型的数据的——视觉数据,也联合很多触觉数据公司,把数据做到毫秒级硬件同步,给世界模型训练提供养料。我们预测,世界模型跟具身智能的GPT时刻可能很快要到来,而且具身智能的市场可能比数字智能大5倍、10倍。我们卖铲子的就不多说了,听听其他模型专家多说一点。

王坚:你刚才讲具身智能的GPT时刻,是不是能够把它改成具身智能的DeepSeek时刻?

张玉峰(无界动力创始人、首席执行官):我以前在地平线做智能驾驶和智能驾驶芯片。世界模型这个概念存在很久了,对于未来状态的预测本身就是一个泛世界模型。我的联合创始人、CTO夏中谱老师,2011年在中科院自动化所读博时研究的就是model-based reinforcement learning,它本身就是世界模型的雏形——只不过那时比AlphaGo打败世界围棋冠军还早了几年,同学们还愁强化学习怎么找工作。这些年强化学习火了,世界模型更火了。

VLA也好,或者类似的、基于本质上模仿学习的范式,它追求的是数据量足够大、分布足够好情况下的概率分布和肌肉记忆。但对于物理世界的底层逻辑的理解,对于提炼关键信息由此带来的比较好的泛化——few-shot、one-shot、zero-shot的涌现一直没有看到。数据稀缺是一方面,但范式本身也有问题。所以世界模型给大家带来了重新聚焦这个概念的机会,也是希望能够突破模仿学习为底层逻辑的范式限制。

具身智能应该聚焦在什么层面?核心是像人一样:以自身的动作为条件,预测世界的下一个状态;或者为达到某个目的,我们到底该采取什么行动?这是人、还有一些哺乳动物与生俱来的能力。我们不需要、也很难学习对于一个物理世界从可见光到原子各个维度的复杂真实模拟,就像天气预报在未来几年可能依然很不准。但人依赖自己大致正确的世界模型,就已经能够完成很多任务。所以无界动力的技术路线是隐空间世界模型——让很多计算不是发生在像素层面,而是让模型学到潜空间的高维表征,更高效地推理、关联时空的因果。

贾奎(跨维智能创始人、首席执行官):这一波AI热潮,从2017年Transformer之后,我们到大语言模型、图像生成、视频生成、3D生成,到现在聊的世界模型。世界模型是整个这六七年生成式AI到目前为止的一个最高潮。因为我们能生成语言、能生成视频、能生成3D,而世界模型是希望能够完全生成符合三维物理几何绝对正确的世界。从这个角度讲,世界模型是“生成式AI皇冠上的明珠”。

跨维智能比较关注的是:你要能够生成三维物理几何绝对正确的可交互动态环境。这意味着世界模型的隐空间、它的token是要能够定义在正确的时空节点上。这样你不仅能生成机器人末端的正确轨迹任务,还能预测机器人或其他物理智能体对环境发生动态改变后,环境怎么正确地变化。世界模型的上限比LLM、VLM、VLA都要高得多,当然对数据的诉求也非常大。

胡鲁辉(智澄AI创始人、首席执行官):我们公司以通用人工智能作为愿景,很自豪国内率先自研世界模型。从AlexNet到AlphaGo、Transformer到ChatGPT,都是现象级的。下一个人工智能是什么?很有可能就是世界模型。我们已经经历了CV时代、多模态大模型时代,也看到了智能涌现和泛化性。下一个问题,人工智能可能要解决的就是理解物理世界——理解可能是个核心。我原来是Meta背景,我们公司用的是JEPA技术路线。相信世界模型能够在人工智能领域起到AlexNet、Transformer这种颠覆性影响。

宋彬(北京飞渡科技股份有限公司联合创始人、总经理):我们做空间智能和数字孪生方向。这几年我们一直在关注世界模型,也总结了一下——大体可以分为几个流派:有基于像素和视频生成的,有基于物理AI角度的,有基于JEPA的,有最新提出的基于因果的,还有基于循环因果的Loop方法。我们看完之后发现一个共性:第一,AI要具备快速理解世界的能力和生成任务的能力;第二,要具备模拟、仿真和推演能力,这必然涉及物理常识,这是其他大模型比较缺乏的;还要有对空间结构、时空拓扑的理解和推演能力,以及因果能力,尤其做ToB、ToG方向,我们需要强因果关系;第三,就是规划和在物理世界上执行任务的能力。

我把世界模型底座能力比作九年义务教育——小学、初中把我们培养出对物理常识、社会伦理、道德的基本认知。上了初中之后开始特殊训练,有些进职高,有些进高中。世界模型底座也是一样,要有很强的泛化和通用能力。

沈宇军(蚂蚁灵波科技首席科学家):灵波是一家给机器人做大脑的公司。关于世界模型我想说两点。第一,非常开心看到大家逐渐意识到视频这个模态对人工智能的重要性。机器人在现实生活中干活,离不开dynamics——不管是突发状况还是整个交互过程,更多的是动态建模,视频方向可能有比较大的提升。第二,世界模型火、潜力大,但我们更关注的是:模型的发展是不是真的对机器人操作有真实的帮助?如果第二点没法证明,前面视频、时序建模做得再好也是空中楼阁。

朱政(极佳视界联合创始人、首席科学家):极佳视界2023年年初成立,到现在三年半,主要标签就是世界模型。当时是语言模型最火的时候,我花非常多精力给投资人讲什么是世界模型,投资人的反应非常一致:你们是非常优秀的团队,如果愿意做语言模型我一定投,但我实在搞不懂什么是世界模型。经过三年发展,到去年情况有了非常大的改观——很多投资人主动找上门。给大家一个直观的例子:去年这个时候我来WRC,公司估值只有现在的1/50。12个月时间,估值涨了50倍。

图片

02


议题二:服务人类,还差哪几步?

王坚:刚才宇军在谈的时候讲到了服务人类。一谈机器人,大家就会谈到人形机器人。如果世界模型要真正服务人类,它今天应该具备哪些最核心的能力?我们离这个目标还有多远?

王晓刚:具身的世界模型应该具备三个核心能力。第一是生成智能。世界模型的核心就是能够生成对未来世界的推演和预测。但光生成漂亮的视频、像素级的美观,还不能完成跟物理世界的交互。缺的第二能力是物理智能,包括空间智能、空间能力,以及跟物理操作的物体的物理规律、物理属性——包括空间记忆。第三个是认知智能。今天我们在具身里做的还是比较Tabletop的简单动作,未来进入更复杂的场景、进入家庭,很长程复杂的任务怎么分解?怎么对动作执行的完成状态进行判断?这需要认知能力。

最先急缺的是中间的物理智能。为什么漂亮的视频并不意味着学到了物理规律?第一,我们今天学的好多视频不是真实的视频,比如电影特效、科幻的视频。第二,我们非常缺工作当中第一视角交互的视频。除了视频本身,还要有相机位姿、几何信息、物理属性、多视角摄像,只有综合起来,才能把物理智能学好。

黄源浩:一方面模型需要不断进化,另一方面数据特别重要。世界模型有很多类别,一种是从理论上出发设计牛顿力学、各种规则;另一种是喂数料涌现出来的。人刚出生也没学过牛顿定律,但看人家怎么做、模仿学习也能做。两条路径都要走。如果世界模型好了,真正机器人能为人类干脏活、苦活、累活,还得本体——手的执行能力、传感器各方面都得好。先从最需要的方向、最贵的、人类最不愿意干的活去落地,后面泛化性好了、智能高了,再往更多场景渗透。

张玉峰:世界模型要能学到对于物理世界底层逻辑的理解、长程任务的完成、场景泛化的支持。我们的总体思路是用工业来练技能——选定一些有商业价值、有复制性、传统工业自动化不太容易做的场景,比如安全带织布柔性物体的操作,基于世界模型的方法能够预测和快速响应被操作物体的形变。用商业场景练泛化——商业场景体现的是光线、背景变化,比如咖啡店、快餐连锁店,任务相对具象但环境有变化。进家庭现在比较有挑战,因为它把几个挑战的维度全放在一起了。

另外,安全性怎么保障?做L4自动驾驶时,模型端到端和额外的安全机制、冗余机制并存也是非常关键的。还有一点,但凡人机共生,语言交互能力非常关键,模型如何能够把人的一些示教,类似于大人教小孩一样,作为上下文让机器人在实际场景下得到学习。

贾奎:人的诉求简单说有两种:一种需要情绪价值,希望有好的内容让人享用;另一种,人希望机器人能给自己把活都干了。世界模型可以生成完全三维几何物理正确的世界——投影到文本就是语言生成,投影到不同视角就是图片或视频。我们也希望用这样的世界模型去驱动机器人,把人从劳动中解放出来。世界模型其实也是整个AI的大一统终局——只要你能够感知理解、生成完全正确的世界,你既可以给人类创作好的内容,也可以驱动机器人。

胡鲁辉:世界模型有两大应用:数字空间和物理世界。在数字空间里,可能是语言模型或多模态大模型的升级,但世界模型核心要解决的是理解的问题。理解很抽象——人对物理世界的理解包括对physical和dynamics的理解、对任务和规划的理解,以及因果关系:怎么预测下一个时空?怎么让机器人做下一个动作?

关于落地场景,我们最早一个订单是家用场景。后来觉得家用、工业或特殊场景,从人工智能理解和因果关系来说其实差不多。但核心关键,家用不仅仅是完成任务,还涉及安全、隐私、伦理。我当时在Meta时,欧盟对Meta有一个50亿的隐私罚款。很多人觉得把规范遵守就可以了,但Meta的理念是通过技术、人工智能方法来解决这些问题。所以世界模型真正能落地,安全技术少不了。

宋彬:讲服务人类,正好刷到抖音里的微短剧。我在想,如果基于世界模型来做短剧行不行?应该可以,至少我们快速生成一个短剧,很可能就能让大家买单。当很多需求是消费级的时候,世界模型已经在做商业化的事了。但面向功能性需求——工程级、工业级,客户要的是可靠性、准确率,而且是长时序里的稳定性的确定性输出。

物理AI泛化意味着多场物理场的耦合求解,还要长时序稳定输出保证正确率,这估计还得攻克很多年。昨天看到一个机器人,跑着跑着跑直线居然撞墙了——说明在开放式环境里,对空间本体和主体、空间结构和时空拓扑的理解推演能力不够。还有时空语义解析成本过高、ROI不合理,导致很难普及。但有一点:今天的AI让解决问题的效率和准确率是倍增的——过去一个问题三年,现在基于这套体系可能倍增。所以离目标多远?可能有一个类似摩尔定律的逻辑来看待这个事——两年、三年,也可能5年。

安全方面,不管AI也好,一旦访问数据本体,一定要有隔离层。我是比较推崇基于本体语义来做隔离层。第二要有熔断机制。

沈宇军:如果说我们要聊的事情是以机器人为载体,AI能服务人类会提出一个新的挑战:机器人本身不能是个功耗太高的东西。在功耗要求比较低的时候,我们如果一边追求智能的上限,一边又要保持低功耗,这个中间可能是一个很难平衡的点。现在的AI范式还是计算——大数据碰上大算力。智能越高,数据越多,参数量越大,推理时消耗的计算资源就更多。但机器人不能不断给自己发电,跟车不一样。在边缘部署的问题会限制算力发挥——如何更高效地让计算发挥价值,在智能上限和低功耗限制之间做好平衡,这可能是真的有一天我们期待机器人服务人类时一定要解决的问题。

朱政:世界模型距离真正能服务好人类,最大的短板仍然是模型能力。知识从哪里来?应该从数据里来。我们训一个具身的基模或世界模型,大部分数据还是无标注视频数据或带标注的视频数据,它和文本数据有本质区别——文本数据天然蕴含丰富知识,但视频数据怎么增加尽可能多的知识?第二步,有了知识之后怎么交给模型?我们的模型参数容量还是非常小的,相比较语言模型可能只有1/10甚至1%。虽然说世界模型要完成任务的解空间比语言模型小一些,但第一步还是要把模型容量足够做大,之后再想办法做小。当然,一个只经过预训练的模型显然不能很好在物理世界运转,需要不停地跟物理世界交互去自进化。

图片

03


议题三:数据,会不会卡住所有人?

王坚:刚才大家讨论里已经谈到了一个很关键的问题——数据。这次人工智能的变革极大依赖于数据来源,世界模型就更加了。世界模型还有一个很大挑战,就是跟物理规律之间的关系。小刚总提到,很多数据都是从电影特效里学来的,有的假的东西让大家看起来像真的,但有些真的符合物理规律的看起来又像假的。真正符合你们需要的高质量数据应该怎么来?怎么治理?数据的成本会不会成为创新企业的不可逾越的障碍?

王晓刚:这是具身和大语言模型非常重要的差别。大语言模型的数据来自互联网,有些互联网企业有天然优势。但具身的数据,尤其是真人操作的数据,历史上积累是0。这些数据从哪来?得从真实的生产生活环境中采集。我们实验过,建实验室雇采集员编剧本让他不停执行动作,对训练效果非常有限。我们真正需要的是in the wild的数据——越自然越好。这就要跟场景方深入合作,制造业、零售、酒店,全国成千上万的工人动员起来,才能实现数据快速积累。

通过实践,我们逐渐看到scaling law:从in the wild采集的数据量逐渐增加时,教会一个本体做某项技能,现在可能几个小时就会了,将来也许更少,也许就不需要真机数据了。数据可以分若干等级——头戴第一视角单目或双目运动相机在单一场景采集的原始视频也能用,但随规模增大,给智能提供的上限比较低。如果身上带多摄像头协同,加力触觉手套,采集场景更加diversify,不但有成功还把很多失败的例子也采集进来——这些数据价值非常高。市场上不同类型数据从几十块到1000块钱左右,市场给了它这样的定位。

黄源浩:数字智能是大算力加大数据催生的,大算力来自英伟达,大数据是互联网本来就有。但具身智能数据是0,怎么办?真机遥操质量非常高但成本更高。数据最重要还是来自于跟人学习。现在大家着急买各种采数据的设备——有了数据模型就迭代快,迭代快就是赢者通吃的市场,第三名以外可能没太大用了。

但数据质量参差不齐,标准也不统一。机器人要跟人学习的无非两个:locomotion移动,强化学习已经做得挺好;manipulation操作——拧螺丝、钉钉子、ICP这种灵巧操作,数据非常少。开始有人用视频,后来用第一视角,发现只有视频没有触觉就加触觉手套,但手套现在还不太成熟。眼睛采到的数据和手套数据可能差15毫秒就已经不对了,力的精度也没有侧滑的力。所以数据飞轮的转动是最重要的。

数据标准更重要。要做到3D空间复原——从视角放大缩小都可以,第一视角第三视角都可以看,空间里手在哪个姿态、哪个位置、力是多少、物体是什么状态,只有完整记录下来数据才可复用、才可跨本体复用、跨模型复用,数据成本才会降下来。期待王院士来主导把数据标准定一下,先做到八成九成慢慢增加。

张玉峰:行业对于数据金字塔已有基本共识:从互联网数据到ego数据、真机数据等。我们这次也发布了可穿戴设备——头上五个鱼眼360度加TOF,手上两个手环。我们的咖啡师就带着这样的设备在做咖啡时采数据。

在数据量上,头部语言模型企业能用到百万亿Token的语料,比具身智能大好几个数量级。现在先过百万条具身智能数据,已有初步行业共识,可能是一个小的拐点。但量是其一,质量很重要。我们比较看重有效信息密度:比较低的是观测观察型数据;第二类简单接触,拿放这些;第三类接触点比较密集,比如易碎物品的抓取,价值相对更高;第四类是失败情况下的数据——这类数据混入训练数据中,如果质量和量都能提升,对模型成功率和失败后可逆情况下的自我恢复有很大帮助。

世界模型天然对数据的依赖性会小很多。粗略估计,相比以模仿学习为基础范式的方式,可能能小2/3的数据依赖量。因为模仿学习很多时候是靠堆数据获得概率分布的高质量性——汽车不撞路牙子,可能就是因为看到了百万次、千万次的轨迹没有压路牙子。但我们人,小朋友骑几次两轮车也就知道碰路牙子什么后果了。

贾奎:我们可能远远低估了实现通用物理AI对数据的要求。人简单对着面前一个东西、两个东西,就可以做出无穷无尽的任务,每个任务对应不同的动作。所以最近我在行业里推动“Physical Token经济学”的思考——不是讲一个Token卖多少钱,而是如果我们真想实现通用物理AI,从最开始的数据基建、模型架构设计到本体到应用场景,该怎么做。

通用机器人的泛化性由两种耦合起来:语义泛化性(机器人看到不同对象知道动作该怎么做)和物理泛化性(测试条件改变后仍能稳定工作)。前者本质上建立在人的认知之上,数据必须来自真实数据——但真机采集非常低效昂贵。Ego-UMI方式一个人一天也只能采500到1000条。我们必须找到一个无成本的方式获取人类语料数据——最好是裸手方式,不影响工作和生活。这样的数据能学到动作该怎么做,但不精准。所以需要高效的后训练方式——跨维智能坚持用合成数据、用生成式仿真做后训练,因为只有合成数据解决物理泛化性问题,才不需要去现场采数据。最终用户付给你的只是替代人工的成本,如果有大量采数据成本,你绝对亏钱。

胡鲁辉:我们今年开源了世界模型,也会开源数据集。物理智能的泛化有三个层面:任务泛化、环境泛化、本体泛化。在数字空间里往往不需要本体和环境,但这三重不是加法是乘法,对数据需求越来越大。不过我觉得往后会有变化:我们人学东西不是第一视角学的,而是第三视角——看着别人学,一下就学会了。往后应该走向第三视角,或者用生成的方式获得更多数据。

世界模型核心想解决的是理解问题。如果人工智能能够有理解这个层面,对数据的依赖性会急剧下降——人学东西是通过理解的方式,不需要无穷无尽的数据。世界模型本身也能生成数据、仿真,这是世界模型的特色。所以对数据这个问题,我觉得应该是比较乐观的状态。

宋彬:围绕世界模型,高质量数据应该怎么做?第一,物理导向、物理常识导向,空间约束条件导向去收集整理治理数据。第二,怎么把相关性变成因果性。我们追求的是因果性,数据关系的建立怎么基于本体语义建立因果。第三,基于观测数据,不是视频照片(做的人已经很多了),而是声、光、电、磁波这些工业体系建立起来的观测数据,去寻找物理规律、时空拓扑,可能会有意外惊喜。

另外呼吁一下:世界模型要叫世界模型,一定是要大、要中观、要微观、要连续化。建议政府、地方、公开联盟尽可能形成一些公开的基础性数据集。我们参与了十四五课题,今年年底会开放一些城市的用于具身智能和科学研究的数据集——研发了两年,会开放出来。数据之间还是要市场化,形成价值交换体系,数据就能流动起来了。

沈宇军:关于数据我就说两个点。第一,核心是要知道对某一东西的精度下限要求到底是多少——大家都会讲精度越高越好,但越高肯定带来成本越高。能不能知道精度到达什么水平时对模型来说就够用了?只有摸清这个点,才能更好做到数据质量和数据规模的平衡。第二,在谈数据总体体量之前,更关键的是数据分布。同样是10万条数据,到底应该涵盖哪些动作、哪些任务?10万个同样的任务其实是没有意义的。

朱政:除了数据规模和标注,还需要重视样本利用效率。我们用几十万小时数据训了一个几十亿参数的世界模型,训练成本可能在1亿左右。如果数据量增长到几千万小时甚至上亿小时,模型参数量再增长10倍甚至百倍,不提升样本利用效率的话,意味着可能要花上千亿来训一个具身基模,这显然不现实,会比语言模型高很多。一个旗舰语言模型从立项到发布大概花几十亿人民币到几十亿美金,商业公司勉强可以接受。但具身基模如果花更多钱,不管从商业还是其他角度都是不健康的。所以一方面不断收集新数据、提升质量,另一方面同步迭代模型,让样本利用效率进一步提升,以便在有限预算下把模型训出来。

图片

04


结语:

一句话,你当下最该做什么?

王坚:最后想问大家,如果用一句话表达——为了实现你们的理想,你们自己当下最应该优先做的一件事是什么?

王晓刚:抓住场景,实现尽早的规模化——无论是数据还是机器人部署本身。

黄源浩:数据标准化,让大家之间的数据可以流通,数据可以服务更多的模型公司。

张玉峰:在保障安全的前提下,加快机器人真机部署,让从落地数据闭环到模型迭代的螺旋上升机制能够迅速产生,在部署中进化。

贾奎:跟行业一起将模型推到更多的应用场景,真实给人类解决问题。

胡鲁辉:核心关键就是技术突破,现在不是互联网时代,要通过技术突破推动人工智能和数据各个方面的发展。

宋彬:空间智能能更好地赋能具身智能的健康、更好的发展。

沈宇军:想清楚我们希望拥有的能力到底是什么。

朱政:在未来几年,从当前垂类场景的世界模型,快速走向真正的通用世界模型。

王坚:特别感谢各位嘉宾的分享,特别是贾奎总谈到关于Physical Token,平时也听你讲过,很受启发。也代表我个人的致敬。感谢所有的嘉宾,谢谢你们的时间,也谢谢你们认真的聆听。

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

扫描上方二维码

或点击阅读原文关注专区。

打开官方原文 站点原文页 可信分区 本信源更多 今日简报 分享图 RSS 稍后再看列表 官媒栏目