2026年3月,AMI Labs首席执行官Alexandre LeBrun预测,六个月内每家AI公司都会将自己重新标榜为世界模型初创公司以吸引资金。尽管这一说法可能夸张,但世界模型已迅速成为AI资本最密集的前沿领域之一——Dyna Robotics、FieldAI、Odyssey和World Labs等供应商已累计筹集约20亿美元,用于构建能够理解和预测物理世界的系统。对于企业领导者而言,挑战在于区分商业现实与市场炒作,并理解这一能力在何处真正有用。
这首先要从定义世界模型开始。与处理文本和代码的大型语言模型(LLM)不同,世界模型学习环境如何随时间变化——这使得它们与机器人技术、自动驾驶汽车、工业运营和沉浸式视频相关。实现这一点需要为物理预测专门构建的架构,目前出现了两种主要方法。视频预测网络(Google DeepMind的Genie 3、NVIDIA Cosmos、Odyssey)采用扩散和Transformer架构,从过去的帧生成未来的视觉帧。与此同时,联合嵌入预测架构(JEPA,由AMI Labs推进)是一种真正的新架构,它在抽象的潜在空间中预测结果,而非像素级别,其依据是这模仿了人类预测世界的方式。
关键的是,物理原理并非以方程形式编程到这些系统中。相反,重力或流体动力学等行为会隐含地从训练数据中涌现,这使世界模型在混乱的真实世界环境中具有更大的灵活性,但也产生了对高质量物理世界数据的显著依赖。
重要的是,并非每个用例都适合世界模型。在工厂、炼油厂和仓库等边界明确、映射良好的环境中,数字孪生配合物理模拟器和LLM驱动的规划通常已足够,并且更容易根据功能安全标准进行认证。世界模型在这些系统失效的环境中最为有价值——例如建筑工地、矿山、户外检查和自动驾驶——这些地方条件可能快速动态变化,超出了物理引擎训练所涵盖的模型范围。
该技术仍处于非常早期的阶段,但已在三个层面积累动力。第一层是合成环境生成,这已投入生产。NVIDIA的Cosmos平台被LG电子和三星等公司用于训练机器人技术和工业视觉系统,无需昂贵的真实世界试验。同样,Waymo使用Google DeepMind的Genie 3构建了用于自动驾驶模拟的世界模型。第二层是非结构化工业环境中的自主操作。例如,FieldAI已将世界模型部署到实际的建筑和工业工作流程中,用于检查、物料搬运和进度跟踪。第三层是通用具身智能,AMI Labs正位于此。这些系统能够在任何物理环境中进行推理和行动,且只需最少的重新训练——尽管这在商业上仍遥不可及。
企业技术供应商必须紧跟这些技术发展,并持续评估利用这些技术所需的合作伙伴网络。Dassault Systèmes已率先行动,宣布扩大与NVIDIA的合作,构建结合其虚拟孪生技术与NVIDIA基础模型的“行业世界模型”。其他工业软件巨头已表示兴趣,但大多数尚未做出同等的公开产品承诺。
如需更多关于新兴AI创新及其对企业与工业公司实际影响的研究,请探索Verdantix AI应用研究,或与我们的分析师团队预约咨询。