微信内可能无法直接打开本站。请点右上角 ··· → 在浏览器打开,或复制链接。
WRC 2026|原生全模态世界模型:从模拟世界到交互世界
RSS 官方收录 · 可信分层展示
关键摘要
8月19日,世界机器人大会(WRC 2026)期间,由跨维智能主办、《财经》杂志协办的“物理AI引领者论坛暨2026《财经》中国AI 100榜单启动仪式”在北京举行。论坛以“物理AI进行时”为主题,汇聚具身智能领域的顶尖学者、企业创始人和一线技术负责人,共同探讨通用物理智能的技术演进与产业路径。…
- 作为原生全模态世界模型代表企业,智象未来(HiDream.
- ai)创始人兼CEO梅涛发表了题为《原生全模态世界模型:从“模拟世界”到“交互世界”》的主旨演讲。
- 他从AI大模型的技术演进趋势出发,系统阐述了大模型从多模态走向原生全模态、从模拟世界走向交互世界的核心逻辑,为Physical AI的底层能…
摘要引擎:抽取
正文提要
8月19日,世界机器人大会(WRC 2026)期间,由跨维智能主办、《财经》杂志协办的“物理AI引领者论坛暨2026《财经》中国AI 100榜单启动仪式”在北京举行。论坛以“物理AI进行时”为主题,汇聚具身智能领域的顶尖学者、企业创始人和一线技术负责人,共同探讨通用物理智能的技术演进与产业路径。
作为原生全模态世界模型代表企业,智象未来(HiDream.ai)创始人兼CEO梅涛发表了题为《原生全模态世界模型:从“模拟世界”到“交互世界”》的主旨演讲。他从AI大模型的技术演进趋势出发,系统阐述了大模型从多模态走向原生全模态、从模拟世界走向交互世界的核心逻辑,为Physical AI的底层能力建设提供了新的技术视角与路径思考。
01 高IQ不等于全能:AI从“理解世界”到“改变世界”
梅涛博士在演讲中指出,过去几年AI大模型的发展可谓一日千里。从大语言模型到多模态模型再到具身智能,三条曾经独立演进的技术路线正在加速走向融合,2026年被很多人称为“世界模型的元年”。

他分享了一组数据:今年年初,顶级大模型的IQ水平约为130,相当于中科大少年班天才的水平;而到如今,最新大模型的IQ已经接近140。但梅涛特别强调了一个关键观点——“高IQ不代表全能”。就像孩子成绩好不代表综合能力强一样,一个在考试中表现优异的模型,不等于能在真实物理世界中长期、稳定、可靠地完成任务。这正是Physical AI之所以重要的根本原因。
大语言模型强在对世界的理解、对知识的压缩和推理;多模态模型强在对世界的生成与预测;具身交互模型则强在与世界的交互。而真正的世界模型,需要同时具备对世界状态的完整表达、对物理规律和因果关系的推演,以及对世界的重构能力。从文本、多模态到具身,过去各自独立演进的三条路线,今天正在加速走向融合。

02.从DiT到UiT:原生全模态架构突破行业上限
基于自研UiT(Unified Transformer)架构,智象未来近日正式发布了原生全模态交互式世界模型HiDream-O1-World。该模型首次参评即在权威榜单WBench中登顶Navi分榜榜首。
HiDream-O1-World支持文本、图像及交互式操控等多模态输入,具备漫游、编辑、交互三项核心能力,同时支持多种主体与风格化场景构建,可高度还原真实空间,也可生成二次元卡通、3A游戏渲染等风格化世界。
从技术底层来看,HiDream-O1-World的核心突破在于长时程的时空一致性与物理一致性,使模型在长时序交互中能够“记住”已探索的场景结构,在复杂交互中保持较高的物理合理性。
HiDream-O1-World正在打开全新的产业应用空间:AI互动影游中,用户成为叙事的主动参与者;具身智能仿真中,模型可搭建高保真虚拟训练底座;3D场景生成中,创作者可高效生成结构完整的3D空间,大幅缩短创意到成品的迭代路径。
以此为起点,智象未来正围绕世界模型的定义持续拓展边界,逐步完善覆盖图像模型、视频模型及交互式世界模型等方向的模型矩阵。
03.数据·模型·智能体·具身:连接物理世界的闭环
谈到具身智能的能力底座,梅涛博士将关键关系概括为:“世界模型和具身智能的发展,需要把数据、世界模型、智能体和具身本体连接起来。”其中,数据构建认知,世界模型负责理解世界状态、推演物理规律,智能体基于预测结果进行决策和规划,具身本体完成真实执行,而真实环境反馈又回流成为新的训练数据。由此形成“数据—认知—行动—反馈”的闭环飞轮。梅涛博士表示,世界模型正是这一飞轮中的认知中枢;没有高质量世界模型,仿真难以逼近真实物理,具身智能的数据飞轮也难以真正转动起来。
最底层是数据底座,包括“互联网的先验数据、仿真的物理试错数据、行动闭环的真实交互数据”,三类数据缺一不可——真实环境的行动反馈,又会回流成为新的训练数据,驱动飞轮持续加速。以互联网先验数据为例,智象未来已积累近千万小时时长的视频数据。中间层是世界模型,作为具身智能的内核,推演世界规律、回答“世界是什么”和“接下来会发生什么”。最上层是智能体与具身系统,基于世界模型的预测结果做自主决策,并由具身本体执行物理动作,完成从认知到行动的完整闭环。
梅涛博士特别强调了仿真数据在Physical AI中的价值。他以智象未来与诺亦腾机器人的合作为例:利用原生全模态大模型对真实采集的人体动作数据进行增强处理,可以生成大量符合物理约束的视频,即同一动作在不同背景、不同场景、不同肤色下均保持一致。这种数据增强能力可以大幅降低真实数据采集的成本和压力,让机器人先在仿真环境中学习,再到真实环境中操练。
这些实践的背后,是智象对未来AI演进方向的一贯判断:大模型让AI理解世界,智能体与具身系统让AI行动于世界,而原生全模态世界模型则将认知、行动与反馈连为一体,让AI真正具备在物理世界中持续学习与进化的能力。
从模拟世界到理解世界,从推演世界到交互世界,智象未来将持续深耕原生全模态世界模型,以技术创新与生态协同双轮驱动,既服务数字智能,也加速具身智能在真实物理环境中的训练与执行落地,助力Physical AI从技术探索迈入规模化、商业化的全新发展时代。