标签: 世界模型

  • 物理AI第一股Momenta来了:自动驾驶迎来“重估时刻”

    声明:本文来自于微信公众号 深响,作者:何理

    AI的风向,已经变了。

    此前,无论大语言模型还是Agent、龙虾,AI始终在“屏幕内”,「数字AI」不断探索边界,也卷成了红海。而现在,在屏幕之外,一个更庞大、更具想象力的AI新战场正在形成——行业目光集体转向能真正在真实世界里动手干活儿的「物理AI」。

    巨头对此纷纷下注:英伟达高调推出全模态物理AI模型NVIDIA Cosmos3,还亮出了机器人领域的全家桶,黄仁勋反复强调物理AI将成为下一波浪潮,世界模型是实现物理人工智能的核心;马斯克也在将AI的触角延伸至物理世界,FSD(完全自动驾驶)实现端到端进化,Optimus人形机器人高频迭代……

    有意思的是,在物理AI的蓝图里,率先承接机会的并非是尚在实验室里练习行走的双足人形机器人,而是已经在公路上比比皆是的智能汽车。自动驾驶是目前非常稀缺的能够同时跑通“海量物理数据闭环”与“高频商业造血”的通用物理AI场景。而世界模型则是物理AI的底座,是激发物理AI“GPT时刻”的关键突破口。

    6月23日,物理AI公司Momenta通过港交所聆讯,正式进入IPO冲刺阶段,即将领衔“物理AI第一股”。在智驾的基础上,Momenta正在打造一个能够理解物理规律、推演世界演变的通用世界模型,成为物理AI基座模型的构建者。

    目前,Momenta R7世界模型已实现量产首发,意味着物理AI正式从技术理念走向规模化量产落地,实现从“看见世界”到“理解世界”的跨越。与此同时,在竞争最为激烈的中国第三方城市NOA供应商市场中,Momenta以高达65%的市占率行业居首,Momenta的客户已覆盖国内全部主流乘用车企业,且全球前10大车企中已有9家与其开展合作,成为“全球品牌的共同选择”,这也验证了自动驾驶作为物理AI的核心赛道的规模化商业价值。

    此外,Momenta的股东阵容极其豪华,汇聚了全球最核心的产业和科技战略投资人,以及全球顶级财务投资人。产业资本囊括了全球汽车产业链的核心玩家,包括:上汽、通用、奔驰、丰田、比亚迪、现代、奇瑞等7家全球顶级车企,以及博世、德赛西威、立讯精密等头部产业链合作伙伴,和Uber、Grab、Stone Venture等Robo合作伙伴。科技巨头则包括腾讯、阿里云、蚂蚁集团、京东等。财务投资人更是覆盖了淡马锡、IDG、阿曼投资局、亦庄国投、Granite Asia、顺为、蔚来资本、凯辉基金、云锋基金、蓝湖资本、创新工场、真格基金、鼎晖投资、高榕创投、高成资本、众为资本、愉悦资本、钟鼎资本、盈峰资本、招银国际、华泰创新资本、混沌资本、春华资本、大湾区基金、国新基金、光合创投、九合创投、锦秋基金等全球最顶尖投资机构。超豪华、多元化的股东阵营,不仅为Momenta提供了战略和资本支持,还从业务协同、用户增长和全球化布局等方面助力了Momenta高速增长。

    世界模型带来新的“GPT时刻”

    说起“物理AI”其实不难理解,简单来说,它就是将人工智能的感知、决策与学习能力,深度嵌入机器人、智能设备、自动化产线等物理实体系统中,使其能够在复杂、动态的真实物理环境中自主执行任务。如果说过去AI突破主要体现在数字世界,那么物理AI的兴起,则意味着AI发展进入了以理解和影响物理世界为核心的新阶段。

    但不同于数字AI,物理AI并不是一条单线赛道。具身智能、自动驾驶、工业机器人、边缘AI,都在把AI从屏幕带进现实世界,它们之间也并非对立关系,更像是物理AI走向现实的不同入口。而世界模型(World Model),正是这一切的共同底座——它是AI理解物理世界、预判未来并自主决策的“内在思维系统”。

    要理解世界模型的关键性,我们不妨将其与大语言模型(LLM)做个对比:

    大语言模型擅长的是“读万卷书”,它理解语义、擅长推理,在虚拟符号世界里无所不知,但它并不真正掌握物理规律,无法本能地理解“推倒杯子水就会洒”;世界模型则擅长“行万里路”,它能够深刻理解物理世界的规则,预测动作带来的后果,并支持AI在现实世界中做出实际行动。

    纯语言模型或传统简单算法的短板很明显:它们要么不懂物理规律,无法应对瞬息万变的动态场景;要么必须在真实环境中通过海量的肉身试错来“刷经验”,比如机器人不断摔倒,这不仅导致硬件损耗成本高昂,更伴随着不可承受的安全风险。

    现实世界场景多变且充满不确定性,人类无法用死板的规则预设所有的突发情况。因此AI必须具备自主理解和预判能力,才能适应不同环境。而世界模型正是要解决这一痛点——在AI的大脑中搭建了一个“虚拟练兵场”,先通过预训练赋予模型理解现实世界的“物理直觉”,让AI真正“懂物理”;再利用这套规律在虚拟练兵场里“脑补”行动后果,配合强化学习的奖惩机制,让大模型在无风险、低成本的环境中反复探索、试错并给出最优决策。这种从理解物理规律到在虚拟试错中进化出最优行动方案的闭环能力,正是世界模型能够打破虚拟与现实鸿沟,成为具身智能和通用人工智能核心基石的关键原因。

    今年世界模型热度明显升温,很多不同的技术路线、不同的场景模型都冠以世界模型:

    有的以语言为中心,比如VLM、VLA是把其它模态、其它能力映射到语言空间。

    有的以像素为中心,比如Sora,实际上是在预测下一个2D像素场景,由于其训练数据大量来自影视作品,模型极易生成不符合真实物理规律的内容,比如像星战“原力”一样违背重力逻辑的画面。图灵奖得主Yann LeCun也曾多次公开批评,生成像素并不等同于理解物理因果;

    还有的以三维结构为中心,比如李飞飞World Labs的"空间智能"理念,从单张图片生成可交互的持久化3D环境,本质上瞄准的是数字世界的构建。但模型重建3D空间不等于理解世界,几何结构也不代表复杂的物理动态演变状态。

    由此可见,当前各个方向的世界模型的痛点核心,在于对物理规律的理解深度,以及能否最终服务于“行动”。我们开发世界模型,不是为了教模型去生成一段好看的视频,而是要教它理解物理规律,并基于这种理解去精准预测下一个状态。行业真正需要的,是把多模态感知、物理规律理解和动作执行三者彻底打通。

    Momenta R7世界模型

    如何构筑物理AI底座?

    而要实现多模态感知、物理规律理解和动作执行三者打通,就必须拥有海量的真实物理交互数据与场景,率先跑通数据和商业规模化闭环,让“数据回流再推动模型能力跃升”的正向循环真正转起来。在这个前提下,拥有断层式数据红利的自动驾驶赛道,自然成为了最先解出这道题的产业先锋。

    无论是Mobileye、Waymo,还是Momenta,这些自动驾驶的头部公司都不约而同地成为了物理AI的排头兵,自动驾驶公司积累的能力,正在被重新理解为可以泛化到更广义物理AI的平台能力。

    Momenta在数据、场景、世界模型架构方面的优势格外显著:

    在数据规模方面,Momenta拥有基于120+亿公里实车里程提炼的1亿段黄金数据,还有真实世界里大量数据反馈,覆盖更多长尾场景。Momenta以真实数据学习生成世界,它可以通过实车和仿真的一致性来做对齐和校准,并拥有明确可参考的基准,这种“真生成”最大程度地减少了仿真与现实之间的差异,比生硬的渲染方式要可靠得多。

    而在世界模型方面,Momenta R7的三层架构更是独树一帜。

    第一层World Model Pre-Training(世界模型预训练), 让模型懂物理。传统的智驾大模型大多是在“背题库”,而R7则是在“学规律”。它通过海量真实驾驶视频的预测训练,将物理规律、常识与因果关系压缩进模型,让系统形成对物理世界最底层的基础认知,不再机械地依赖人工规则。

    有了物理常识,模型需要演练,第二层World Model Simulation(世界模型仿真),就是让模型拥有“练兵场”。R7利用生成式模型推演周围环境进行闭环仿真,让系统能够推演自身行为变化时世界将如何演变。依托这种高效场景推演能力,AI可以对现实中很罕见、很危险的长尾场景进行性能评估,其效率比传统实车路测提升了上万倍。

    第三层则是World Model Reinforcement Learning(在世界模型中进行强化学习),系统通过精心设计的奖惩机制让大模型反复探索与试错。它在虚拟世界里经历千万次的博弈推演,自主学会了在复杂多变的动态环境里如何做出最优决策,最终输出更安全安心、高效丝滑的类人驾驶表现。

    这套架构可以说是物理AI现实价值的直观体现。比如开车的时候,前方意外掉落一箱苹果,Momenta就可以自主预判苹果滚落的轨迹与扩散范围,提前平稳减速、规划绕行路线,以更从容、更贴合人类驾驶逻辑的方式处理突发路况。

    Momenta R7理解的是物理世界的运动规律与交互逻辑,而非依赖场景记忆与规则匹配。真正的物理AI,不只是让车辆在绝大多数日常场景中顺畅行驶,更要在万中无一的罕见极端场景中,依然为用户提供更稳健的安全保障。

    从整体视角来看,Momenta R7世界模型这三层架构并不是孤立的三个模块,而是一个有机统一、高频自运转的整体:一方面认知一体,从第一层的“理解物理”,到第二层的“推演未来”,再到第三层的“动作决策”,R7架构打破了过去感知、预测、规划各自为战的割裂状态,信息在同一套基座模型中流动;另一方面可以自进化,第一层提供认知,第二层提供空间,第三层在空间里刷经验,三者互为因果,数据在内部滚动即可实现模型的自我升级。

    目前行业内普遍仅将世界模型用作“生成数据”的仿真工具,好比考前多刷一些模拟题,Momenta是市场上极少数直接将世界模型用于“端到端基座模型预训练”的公司。这种底层的应用代差,让系统整体的产品性能和进化上真正与其他人拉开距离。

    另外,招股书显示,2025全年Momenta研发投入为18.69亿元,占其年度收入的77.5%,近三年累计研发投入达46.6亿元。截至2025年底,公司拥有研发人员1157名,研发人员占比近82%,超过三分之二拥有硕士及以上学历。坚决的研发投入会进一步巩固和加强Momenta的技术领导地位。

    技术跨场景落地

    指数级优势显现

    而更重要的是,技术的积累正在落地于应用。Momenta R7世界模型已经走出了实验室,在真实的产业与资本浪潮中率先跑通了数据+商业的两大闭环。

    一方面是实打实的量产,Momenta R7世界模型已量产首发,目前搭载Momenta系统的量产车辆规模已超90万台,已成功交付超100款量产车型,累计定点车型数超210款,并实现最快不到40天交付10万台的高效部署。复杂路况下产生的海量交互数据,实时、高频地流回模型,会进一步促使 R7实现指数级自我进化。

    另一方面则是实打实的营收,招股书显示,Momenta近三年营收规模实现跨越式增长:2023年至2025年,Momenta营业收入从7.43亿元增长至24.13亿元,三年翻三倍,年均复合增长率超80%。截至2025年底,公司现金储备超100亿元,为加速Robo市场和全球化发展提供了有力支撑,有利于其在物理AI的长期战役里占据主动权。

    图片

    图源:招股书

    由此Momenta得以形成飞轮效应,“平台级”的架构将终结过往各场景孤立开发、重复造轮子的传统模式。其用一套大模型同时覆盖乘用车以及无人驾驶出租车(Robotaxi)、无人物流车(Robovan),2027年还将扩展至无人驾驶卡车(Robotruck)领域。

    核心底层技术的跨场景复用,极大地摊销了多业务线并行的研发成本,使得边际成本大幅降低。可以想象,未来这种从智驾中锤炼出来的、打通了“感知-物理常识-行动”的底座能力,还可以无缝延展到具身智能、工业机器人等更广阔的通用物理 AI 领域。

    图片

    Momenta的“两条腿”策略

    目前,智驾领域正呈现出一种“摩尔定律”式的进步节奏,在端到端与世界模型的加持下,行业部分头部企业开始展现出远超以往的能力迭代速度。

    而Momenta的规模效应和先发优势也在多个维度展开:体验上,数据越多,算法越聪明,体验越好;交付上,建立工程化壁垒后迭代极快,Momenta 交付首个10万台车用了整整2年,而如今仅需要不到40天即可完成10万台车的交付;客户上,头部车企的信任也在不断积累,在 Momenta 的客户群体中,既有BBA德系豪华,也有通用、大众、丰田、日产、本田等20余家全球主流车企,拥有不同背景的中德美日韩顶流品牌,这些合作案例也成为 Momenta 量产能力和市场接受度的最直观证明。

    回头看AI的发展路径,会发现一个有趣的规律:每一次技术范式切换,资本市场最终定价的都不是某个单点产品,而是能够定义下一代基础设施的平台能力。

    大语言模型时代,市场重估的是能够理解和生成信息的数字智能;而当AI开始走出屏幕、进入真实世界,市场重新寻找的则是能够理解物理规律、预测世界演化并驱动行动决策的物理智能。从这个角度来看,Momenta上市的意义,不仅是自动驾驶业务的资本化,更是世界模型、物理AI第一次进入公开市场的价值验证。

    行业普遍判断,智驾及物理 AI 底座最终将是“马太效应”的局面,未来全球市场最终可能只会留下少数头部玩家。而Momenta势必能以自身的稀缺性、技术领先、商业闭环迎来“赢者通吃”的应许之期。

  • 从连接线上线下,到构建AI底座:美团在两个时代的基建接力

    声明:本文来自于微信公众号 锌刻度,作者:邹珊

    2026年伊始,“小龙虾”等Agent爆火过后,“物理AI”这个更进一步的概念出现在公众视野。

    OpenAI的Sora团队转去世界模型研究;图灵奖得主杨立昆也创办了相关公司……业界重押“世界模型”,是因现实场景不足,转而打造 “线上地图”,让AI更好地理解“物理世界”。

    在中国,除了对“虚拟世界”的投入,“物理AI”方向还有另一种进展。随着一张涵盖了宇树、月之暗面、银河通用、智谱AI、摩尔线程等40多个硬科技企业的被投名单曝光,网友们发现背后的投资方美团,正在做更进一步的落地。机器人、智能算法、视觉识别、边缘芯片、激光雷达——已经在仓储分拣、药店零售、无人配送、低空经济、推理部署等多个场景,规模化应用了。在外界计算美团有多少的账面浮盈时,一个底层的逻辑线浮出水面:当下王兴反复强调的“打造物理世界的AI底座”,与美团过去十多年在本地生活领域所构建的庞大“基建”,其实是一场连贯的 “水电改造工程”。

    外界常将美团的硬科技布局解读为 “跨界转型”,却忽略了背后的一致性:美团早年扎根本地生活,搭建的线上线下服务体系,与如今重仓具身智能、芯片、AI大模型等硬科技的布局,本质上其实都是在做 “连接”——只是从连接线上需求与线下服务,升级为连接物理世界的人、机、物。核心目标始终是通过底层建设,提升服务效率,优化用户体验。

    美团外卖

    上个10年:打通线上世界与线下服务

    移动互联网的浪潮中,美团的崛起并非偶然。

    2010年前后,本地生活服务市场尚处于蛮荒阶段,线上线下割裂、服务效率低下、供需匹配错位是行业普遍痛点。美团一开始就没打算做简单的信息撮合平台,而是要做“本地生活服务的数字化提效”。

    这也是美团后续所有战略的底层逻辑。

    线上,是看不见的算法调度。

    外卖配送中订单量、距离、交通、天气等现实中的变量,随着长期数据积累、算法迭代,变为配送时效的提升。背后是无数外卖员的路线反馈,商家出餐的实时预估。据说美团的算法工程师们,会骑电动车穿梭于餐厅和小区,了解配送环节骑手、商家和用户的痛点,然后再做优化。物理世界和线上技术的打通转化,那时已经开始。

    更早期的本地生活,还是用户找服务。美团用搜索和智能推荐,实现了“服务找人”,基于真实的评价体系,地理位置、消费习惯、偏好的匹配,让用户有了更近、更中意的服务选择,中小商家则获得低成本的曝光。分散琐碎的场景,不透明的信息,不畅的沟通,都随着“数字化连接”渐渐抹平了摩擦力。

    线下,则是触达物理世界的“毛细血管”。

    数百万骑手组成的即时配送网络,覆盖全国2800多个市县,深入社区、商圈、乡镇这些中国最复杂的物理环境——这套履约网络的价值,也让美团触达到海量的细分场景和用户商家需求。

    彼时,中国餐饮服务、生活娱乐业态下的中小商家,曾是“触网能力”较弱的群体。美团的商家服务团队,用多年时间帮助传统商户接入数字化系统。如今,覆盖数百万商家的Saas系统——点餐支付、接单打印、后厨显示、库存供应链管理、经营工具,乃至柜台边的共享充电宝,都已是生活服务领域里的基础设施。

    在此前的10年里,从线上的算法、推荐、评价体系,到线下的履约网络、商家服务、硬件工具,美团完成了一次物理世界的数字化初步改造。它让原本零散、低效的本地生活服务,变得标准化、数字化、高效化。在这个过程中,美团也形成了两个能力:一是对复杂民生场景的理解,二是与生态伙伴共生的协同能力。这也是美团打造物理AI底座的“软件”基础。

    这场“数字化改造”,形成了开放的生态。用户、骑手、商家、技术合作商,都是基建参与者。

    如今,这种开放的生态思维,延续到了其硬科技布局中。

    AI时代:用硬科技 “升级”基础设施

    2026年初,王兴在内部讲话中提到:“物理世界的数字化将是AI非常重要的底座。”

    美团的行动,其实已在数年前就开始了。

    这种前置也体现在投资节奏中。早在2020年,美团正式确立 “零售 + 科技” 战略,投资重心从大消费全面转向硬科技。当2022年互联网大厂投资数量骤降70%的寒冬期,美团却坚持对硬科技领域逆势投入。5年来,美团硬科技投资的数量占比一直保持在50%以上,已经覆盖了AI大模型、具身智能、半导体、智能硬件、智能驾驶五个主要领域。

    把分布在这五个赛道中的技术方向进行拆解,会发现美团的的动作并非“跨界”,而是在已有本地生活的基础设施上,吸纳前沿技术自然延展。

    如果说,此前对线上需求与线下服务的连接,是完成物理世界数字化的初步改造,当下就是对物理世界的智能化重构——具身智能、芯片、AI 大模型等领域的技术融入,延续着美团的“基建思路”,与本地生活多个细分场景深度协同。

    具身智能可以理解为“行动载体”。也是美团布局最早、投入最深的领域。目前美团至少投资16家企业,其中10家已成长为独角兽。从全球人形机器人出货量第一的宇树科技,到零售、医疗场景规模化落地的银河通用,再到具身大模型研发领先的自变量、星海图,美团均在早期入局,且核心合作模式并非财务投资,而是开放场景、共同探索。

    2026年1月,自变量的机器人在真实场景中展示了取餐、折叠纸箱到从室外穿越玻璃门、自行乘梯、送餐的过程, 实现全程自主。

    在北京等地的10多个药店, 都有Galbot机器人机器人24小时值守,银河通用已经向美团买药的商家交付了数十台机器人。在武汉和广州,分别有100台立镖机器人在仓库中进行分拣工作,此前它们也曾在零售生鲜等场景中工作。

    如果说机器人代表“执行任务的肢体”,那大模型则是整个基建体系中负责指挥的“大脑”。

    正如王兴所言,“让爱因斯坦订餐厅,他依然不知道那个餐厅有没有座位”,这本质上是信息问题。大模型的能力,可以将海量的线上信息(评价、位置、菜单)与线下动态信息(座位、排队)结合交互,做出最优决策。

    基于自研多模态 LongCat 系列大模型能力,美团已推出面向 C 端的 “小美”“小团” 和面向商家的 “袋鼠参谋”“智能掌柜” 等 AI 工具,有超过340万商家通过AI工具降低运营成本。

    不少在多年前实现了“触网”的商家,如今又进一步实现了AI智能化。

    而芯片半导体意味着 “算力能源”。除了GPU方面的摩尔线程、沐曦股份,美团在天使轮阶段或A轮阶段,就参与投资爱芯元智、荣芯半导体、东方算芯等多家专注视觉芯片、晶圆制造、芯片架构等公司,同时布局了多家新型材料、移动通信领域的头部公司。

    高峰期的履约调度、APP侧的用户消费需求,无人配送及商家后厨、经营侧的数据交互,都需要海量的实时算力支撑。一些被投企业的提效算法、芯片能力,已经融入相关的实际业务。

    还有一些关键技术,已进入到美团的无人配送体系。比如禾赛科技2021年底就与美团达成战略合作,4年间已经有多款长、中、短距离的激光雷达应用于美团的无人机、无人车。美团近630万单无人配送订单背后,已规模化应用了很多硬科技。

    当美团无人机用10多分钟时间,为香港山区的独居老人送上热餐,很难不让人感慨这些“生活基建”的进化程度。

    两个时代的基建,都没有交付的捷径

    世界上不存在“一夜之间”的战略转型。放眼全球,长期的基建思维始终是头部科技企业穿越周期、构筑核心竞争力的关键。

    微软单季投入350亿美元,将数据中心容量提升八成,搭建 AI 算力基建;谷歌将资本开支抬升至900亿美元以上,依托搜索、云服务等场景构建AI底层能力; 工业巨头西门子,在工厂、工业供应链里,规模化部署了AI应用、自动化能力。

    这些巨头的路径各有侧重,它们大多从自身所处的线上世界,或标准化较强的场景出发。美团相反——它从一开始就出现在充满变数、遍布“阻力”的市场中。随着长期的连接改造,很多“重力”十足的商业形态,遍布“卡点”的线上世界和线下世界,打破了“次元壁”。

    互联网时代完成的数字化改造,已成为AI时代的进化底座。这种从场景中长期生长出来的能力,比技术参数更难被复制。

    上一个10年,美团构成了商业生态。现在,他们开放自身的场景、数据资源,与被投企业共同探索,让AI进入物理世界的路径。

    这种“场景换智慧”的模式,不仅加速了被投企业的成长,也让“物理世界的AI底座”更为牢固。

    从本地生活的线上线下连接,到物理世界的AI底座,美团的战略演进,看似跨度巨大,但底层逻辑高度一致。

    从商家的SaaS系统到AI提效工具,从配送的算法调度到无人机里的精密技术,美团一直在用看似笨重的方式,为本地生活提升效率——但现实中的很多复杂问题,只能用这种方式交付。

    如王兴所说,“我们是一家连接线下业务和线上世界的科技公司。在AI时代,我们将继续扮演这样的连接者角色,实现数字世界和物理世界之间的连接,这是我们的强项所在。”

    这背后,除了对物理世界和数字世界的理解,或许还有一种战略耐力:相信技术,终将更好地服务于人的需求和体验。