tmp8q9hy257
一个大型仓库要变成可训练的三维环境过去的做法是推着激光扫描设备走上一整天回来再清理点云。World Labs 在 7 月的演示里这件事变成了掏出手机拍一段视频取其中 24 帧。9 月 1 日李飞飞创办的 World Labs 发布新一代世界模型 Atlas瞄准的正是这类场景。一、Atlas 现在能做到哪一步先摆能力边界方便后面讨论。能力具体规格状态摄影机可控生成1 至 6 张输入图配手动设计的摄影机路径输出最长 1 分钟、1440p 视频官方公布三维输出可输出点云point cloud与 3D Gaussian Splat官方公布场景重建24 帧手机视频即可重建大型环境官方演示机器人仿真生成机身摄像头视角的 RGB 与深度画面官方演示量化评测仅公布摄影机条件生成与三维重建两项官方说明开放状态Early Access仅限部分合作伙伴申请官方公布这次最实用的改动是 Pixel-Perfect Camera Control。用惯 AI 视频工具的人熟悉那种体验写一句「镜头缓缓左移」按下生成画面可能左移了也可能绕到别处人物和场景的一致性多少带点运气整个过程更像抽卡。Atlas 把顺序反了过来摄影机的位置、角度和运动轨迹不再是一句文本描述而是模型的原生输入类型先设计摄影机怎么走模型再按这条路径生成画面。这个改动的意义不止于「更好用的视频工具」。一段视频如果摄影机不可控本质上还是一张会动的图摄影机一旦可控说明模型内部对「空间里存在什么」有了稳定结构否则无从回答「从这个位置看过去应该是什么样」。这个能力也不是 Atlas 凭空长出来的。World Labs 在 2025 年 11 月 Marble 的发布文章里已经把 pixel-accurate camera control 列为视频导出能力Atlas 做的是把它从产品功能下沉为模型能力。Atlas 还能输出点云和 3D Gaussian Splat也就是能被其他软件直接读取的三维场景这一条决定了它的竞争对象不是 Veo 或 Sora。影视可以做虚拟摄影和 VFX游戏能快速搭场景机器人可以把真实环境重建成仿真环境World Labs 自己画的目标是生成、重建、模拟一个世界。World Labs 在评测部分有一句坦白的话Atlas 是能执行多种任务的全模态模型没有任何单一基准能完整覆盖它的通用性所以只挑了两个关键任务做量化评测。这句话反过来提醒读者官方演示覆盖的是模型能力里最容易展示、也最容易量化的那一部分。二、没拍到的地方它在猜给 Atlas 一张房子的正面照片再把虚拟摄影机移到房子背后。原图里没有背面的任何像素模型会生成一个看上去合理的背面。World Labs 官方举的例子是泳池一张泳池照片没拍到旁边的完整环境模型会猜测那里可能有草坪补上第二张、第三张真实照片需要它自己想象的部分就越来越少。官方原话是给模型看的东西越多它想象的东西就越少。这句话恰好说明世界模型不是「把照片转成三维」的算法后者只做插值前者要做推断。模型内部真正在回答的问题是已经看到了这些这个空间完整的样子可能是什么。支撑这件事的是 Spatial Context空间上下文。语言模型工作时把前面的文字、图片放进上下文再预测接下来该生成什么Atlas 也有上下文只是多了一样东西每一张图片不只是图片还明确对应三维空间里的一个位置和摄影机姿态。于是模型面对的问题变成这里有一张客厅照片摄影机在这个位置那里有一张厨房照片摄影机在另一个位置中间应该是什么。官方演示过把两张原本毫无关系的照片摆进同一个三维空间模型会自己生成走廊、门洞这类结构把两个场景接起来。这就是它被称作世界模型而不是视频模型的原因。三、到底什么是世界模型这个概念比大语言模型古老得多。World Labs 在一篇专文里追溯到 1943 年心理学家 Kenneth Craik 提出心智可能是通过在头脑中运行现实的「小规模模型」来推理的这个说法后来被强化学习和机器人领域长期沿用。可以把它理解成一套装在模型里的世界模拟器。桌边放着一只杯子人不需要真的把它推下去也能预判被推之后向桌边移动、失去支撑、落地的过程因为脑子里已经有一套关于物体、空间、重力和运动的基本认识。World Labs 还给了一个很好用的三分法把现在所有自称「世界模型」的东西拆成三种功能类型输出什么质量标准成熟度Renderer渲染器像素给人看的画面视觉 fidelity保真度最成熟已大规模商用Simulator模拟器状态可被计算的几何与物理结构几何、物理、动力学是否正确最关键也最不成熟Planner规划器动作下一步该干什么能否达成目标最新生用这个框架回看房子背面那个例子问题就清楚了模型填出来的背面属于渲染器级别的「视觉上说得通」不是模拟器级别的「结构上正确」。拍电影前者够用要让机器人绕到房后操作一台设备后者才够用。一个常见误解是大语言模型只懂文字世界模型才看得懂图片和视频。这个说法已经不成立主流大模型早就是多模态的。真正的区别在于把什么当作核心问题来学习ChatGPT / Claude / DeepSeek 等世界模型建模对象语言、知识、逻辑、代码空间、时间、物体、运动核心问题应该怎么回答接下来世界会变成什么样上下文构成Token、文本、图像图像、视频、三维位置、相机姿态、状态常见输出文字、代码、推理、工具调用图像、视频、三维环境、未来状态Agent 落点操作数字世界感知和操作物理世界长期应用助手、编程、办公 Agent机器人、自动驾驶、仿真World Labs 的表述是语言模型学习文本的统计结构世界模型学习空间和时间的统计结构包括光如何落在表面、一个花园从没被拍过的角度看是什么样、物体受力之后如何遵循物理法则运动。四、三条路线不是一家在押注李飞飞并不孤单。Google DeepMind 在 2025 年 8 月发布 Genie 3从文本提示实时生成可导航的动态世界24fps、720p一致性可保持数分钟目前是 limited research preview。DeepMind 明确把世界模型视为通向 AGI 的关键台阶理由是可以让 Agent 在无限丰富的仿真环境里训练。Meta 走的是另一条路。V-JEPA 2 不追求生成漂亮画面而是让模型从视频里学三件事理解、预测、规划。模型 12 亿参数用超过 100 万小时视频加 100 万张图像做自监督预训练再用不到 62 小时未标注的机器人视频训练出动作条件版本 V-JEPA 2-AC零样本部署到两个不同实验室的 Franka 机械臂上完成抓取和放置且没有从这些环境采集过任何机器人数据。World Labs 自己已在 2025 年 11 月把 Marble 全面开放支持从文本、图片、视频或粗略三维布局生成可探索的三维世界并导出 Gaussian Splat 与网格。Atlas 的定位是下一代底层模型官方已明确它将驱动未来版本的 Marble 及其他产品。三家路线不同指向的判断却一致只有语言智能不足以让 AI 进入现实世界。五、最大的想象空间在机器人2026 年 7 月World Labs 收购机器人公司 SceniX 时的表述很直接机器人是空间智能真正变成物理能力的地方。逻辑不复杂。训练大模型数据从互联网来成本几乎为零训练机器人完全不同物体要复位、失败要恢复、硬件要维护很多危险场景根本没法反复试。World Labs 给出的路线是 Real-to-Sim-to-RealR2S2R把真实任务重建成可交互的仿真世界再在仿真里系统性地变化外观、物体配置、杂物、物理属性、机器人状态和相机视角一个真实任务衍生出数千种变体策略在仿真中训练完成再回到现实。7 月那篇文章给出的数字是每个检查点在仿真中跑 2000 次试验1000 次分布内、1000 次分布外在真实世界跑 100 次各 50 次。多个策略以零真实世界训练数据完成迁移其中线缆操作、试管转移、马克笔分拣等任务连续自主运行一小时无人工干预。如果这条路走得通训练机器人会越来越像今天训练游戏 AI现实世界只提供少量数据大量失败、探索和测试都放到仿真里完成。六、但「合理」不等于「真实」看到这里容易冒出一个激进结论世界模型是不是已经掌握物理规律了。还远远没有房子背面那个例子就是最直接的答案模型没见过背面就生成一个合理版本而合理和真实是两件事中间的距离正是渲染器与模拟器之间的距离。一团火很能说明问题。AI 视频模型能生成肉眼几乎挑不出毛病的火焰但要拿它做物理模拟还得回答温度多少、空气怎么流动、附近材料会不会燃烧、热量如何传导。这个差距不是靠参数规模或数据量就能填平的。World Labs 列出的开放难题里有几条格外扎眼带显式几何、材质属性和物理标注的三维数据比渲染器训练用的互联网视频少几个数量级Sim-to-Real Gap 依然存在仿真里的行为和现实里的行为仍有差别生成式仿真带来一种新风险AI 生成的几何可能看起来正确却包含自相交或错误尺度导致物理行为荒谬刚体、可变形物体、流体、布料同时交互的多物理场仿真成本仍比单领域仿真高出几个数量级。还有个现实问题Atlas 目前处于 Early Access只面向部分合作伙伴需要申请。这意味着官方演示之外的几件事暂时无法验证包括不同场景下的稳定性、更长时间后空间是否仍一致、复杂物理交互的程度、真实生成成本与速度、生产环境里的成功率。所以现在说「AI 已经理解物理世界」太早。更准确的说法是AI 正在从生成世界的样子开始尝试学习世界怎么运转。七、世界模型会取代大语言模型吗大概率不会更合理的未来是两者合流语言模型负责要完成什么目标、任务该拆成哪些步骤世界模型负责现在在哪、周围有什么、采取这个动作之后可能发生什么最后由机器人或 Agent 执行并回到观察。World Labs 的渲染器、模拟器、规划器三分法对应的正是这条链路它自己判断三者最终可能融合成一个统一的世界模型。过去几年大模型竞争有一套明确的衡量方式谁的推理更强谁的代码更好谁的基准分更高谁的 Agent 能完成更多电脑任务。如果世界模型继续往前走竞争的维度会扩大问题会从「这个模型知道多少」变成「这个模型懂不懂一个世界是怎么运转的」。Atlas 还没走到终点。但从 World Labs 的 Atlas、Google 的 Genie 到 Meta 的 V-JEPA几条路线正在往同一个方向收拢。大语言模型让 AI 学会了谈论世界世界模型想解决的下一步是让 AI 学会观察、想象、预测然后真正进入这个世界。想听听各位的判断World Labs 自己承认模型没拍到的地方是在猜喂得越多猜得越少。这个机制在影视和游戏里是优点放到机器人上就成了风险。以下四个方向哪一个最可能先跑通商业闭环A. 影视与游戏摄影机可控已经够用视觉合理性就是交付标准B. 机器人训练Real-to-Sim-to-Real 能把数据成本压下来价值最大C. 设计与建筑可探索三维空间替代部分建模工作容错率适中D. 都还早Sim-to-Real Gap 没解决之前落地都谈不上欢迎在留言区说说选择和理由也欢迎补充见过的实际案例。觉得这篇梳理有用点个在看让更多关注 AI 的朋友看到。关注公众号「硅海拾遗」每周拆解 AI 行业里最值得说的那件事。参考来源Atlas: A World Model for Spatial IntelligenceWorld Labs2026-09-01A Functional Taxonomy of World ModelsWorld Labs2026-06-03Genie 3: A new frontier for world modelsGoogle DeepMind2025-08-05V-JEPA 2 world model and new benchmarks for physical reasoningMeta AI2025-06-11Marble: A Multimodal World ModelWorld Labs2025-11-12World Labs Acquires SceniXWorld Labs2026-07-21Building Worlds That Train RobotsWorld Labs2026-07-28