
AI 生成的视频已经真到以假乱真。看过的人多少闪过一个念头:AI 是不是开始懂这个世界了?
九月开头,李飞飞的 World Labs 发布了新模型 Atlas,官方开篇就把它定位成四个字:世界模型。这个名字,就是冲着纠正上面那个念头来的。
要分清这俩,得先弄明白一个问题:它俩一个在学「像」,一个在学「为什么会这样」——差在哪?
先说结论
- 是什么:AI 先在心里搭个会转的世界,想明白再动手
- 为什么重要:机器人练手前,得先有个撞不坏的虚拟世界
- 我的判断:会画视频的 AI 很多,会「想世界」的才刚起步
画得像,不等于懂物理
画得像,是一种本事;懂物理,是另一种本事。
神笔马良画了只鸟,鸟活了,扑棱棱飞走。那是神话,因为那支笔把「画」变成了「真」。现实里的 AI 画师是另一种马良:画得比谁都像,笔下的鸟却始终不会真飞。它只是从海量视频里学会了「鸟飞起来」该长什么样,能续得一模一样。可翅膀怎么扇、空气怎么托住它,不在它的课本里。
工科生是另一路人。让他画鸟,他先做受力分析:翅膀面积够不够,扇多快能离地。画出来未必好看,但你要问这鸟能不能飞,他答得出依据。
OpenAI 的视频生成模型,是前者里最出名的代表,把画面生成做到了极致。可再像,它学的也是「什么样的画面后面接什么画面」,跟物体为什么动无关。

视频 AI 学的是「像」,世界模型学的是「为什么会这样」。两拨人的分界就在这儿。
世界模型,就是 AI 的脑内沙盘
「为什么会这样」怎么教给 AI?先让它在内部搭一个会自己运转的世界副本:记得住物体长什么样、摆在哪,能预判下一秒会发生什么,还能在真动手前,先在心里试一遍。
这个「先试一遍」,人天天在用。开车到路口,前车突然减速,你不会真撞上去试。脑子里已经推演完:现在刹车,停不停得住?这个不出声的推演,就是脑内沙盘。人人都有,AI 以前没有,世界模型想补的就是这块。
想法不新。上世纪九十年代就有人提过雏形;2018 年,一篇叫《世界模型》的论文把它正式拆成三块:一块负责看,把画面压成要点;一块负责记,把要点串成规律;一块负责动,照规律拿主意。论文还配了个开赛车的小游戏做演示。「世界模型」这个词也不是论文发明的,九十年代就有人这么叫了。是这篇论文让它重新火起来,在深度学习圈被广泛用开。

从论文走到头条,中间隔着一场大架:AI 到底该怎么懂世界,几家吵了两年多。
吵了两年多:AI 该怎么懂世界
架的第一棒,是 OpenAI 自己递出去的。2024 年初,它发的那篇论文,标题就叫《视频生成模型作为世界模拟器》,等于给自己贴了张标签:世界模拟器。
LeCun 第一个不服。这位前 Meta 首席 AI 科学家、如今自己创办了 AMI Labs 的人,公开说过:想靠一格一格画画面来理解世界,又费劲又走不通。他觉得 AI 该在更抽象的层面做预测。人判断「杯子要倒」,靠的也不是在脑子里把杯子完整画一遍。
李飞飞 2024 年在一场 TED 演讲里,接过了话头。演讲开头她讲了个意象:生命在黑暗里摸索了极其漫长的年代,直到第一只眼睛睁开。她想做的,是给 AI 装上那只眼睛,别让它只盯着文字。她管这个方向叫「空间智能」,意思是让 AI 搞懂:东西在哪儿、怎么摆、动起来会怎样。
到去年 11 月,她又把这套想法讲深了一层。在自己写的长文里、在好几场访谈里,她都这么说:语言是根又细又慢的管子,人类靠它传给 AI 的知识漏掉太多。世界是立体的、会动的,文字装不下。只会读写的大语言模型,在她眼里像黑暗里摸字的人——字认得再多,也从没见过光。
三家的答案摆上桌:世界该靠画面学,还是该在抽象里学,还是该在空间里学?吵到现在没结论。
那个扛着标签的模型,倒先给这场架添了个注脚:今年 4 月,OpenAI 悄悄把它下线了。官方的口径是战略取舍:算力收回去做编码、企业和机器人,跑这类大模型也确实烧钱。这不能说明这条路就死了。但它至少提醒我们(这是我的解读):光会画,撑不起一个烧钱的产品。
Atlas 的三板斧,翻译成人话
吵归吵,李飞飞的公司直接动手做了个成品。Atlas 的官方口径是「全能世界模型」,文字、图片、视频、三维模型,一把抓。
技术词先翻一遍。官方说它的底层是「多模态自回归扩散 Transformer」——这串字不用记,记住原理就够:它和聊天 AI 一个套路,靠预测「接下来是什么」干活。聊天 AI 预测下一个字,它预测下一个画面。差别在于:它脑子里每个画面都带着一个确定的空间位置,补出来的部分,得跟已经看到的在三维世界里对得上。所以它画的时候,得先想明白:这个场景换个角度看,该长什么样。到这你可能会想:这不还是「预测下一个画面」吗?跟你平时见到的视频生成 AI 有本质区别吗?直说结论:没有。Atlas 跟它们本来就是同一个大套路,差别只在于多了一道要求——每一个画面,都得和三维空间对得上。这道多出来的要求,就是前面那场架落进产品里的样子:OpenAI 赌「画面接画面」够用,李飞飞赌的是,得先让 AI 把空间想明白。
Atlas 亮出三件本事。
第一件,补视角。 给它几张参考图,你指定镜头往哪走,它把没拍到的角落也补出来。画面跟着镜头走,最长能走到一分来钟,清晰度接近影院级。对普通人的意思:以后拍短视频想要第二个机位,不用重拍,AI 帮你想出别的角度。
第二件,搬场景。 给它几张真实照片,它能把整个场景重建成立体的、能走进去的三维模型,人能在里面走动看。对普通人的意思:手机随手拍几个角度,一间屋子就被搬进电脑。以后看房、做游戏场景,可能都走这条路。
第三件,造考场。 给它一段真实录像,它能在虚拟世界里复刻同样的场景,让机器人先在假世界里练。练导航、练抓东西,摔了不心疼,灯光、障碍还能随便改。
以前 AI 是给你画画,Atlas 想给你搭一个能走进去的世界。
冷水也得泼:这些演示目前只对部分合作伙伴开放,不是谁今天都能上手。官方还做过一轮用户偏好对比,对手是市面上几款头部生成模型。跑出来的数字是:Atlas 领先 75% 到 94%。但这是官方自测,第三方还没复现——先当参考,别当结论。更要紧的是,这些演示能证明的,是「画面与空间」的本事。至于它搭出的世界,物理够不够真、长时间演算会不会崩——这直接决定它配不配叫「世界模型」,而这一点,目前还没有第三方验证。
机器人是它最大的考场
为什么这个方向值得盯?因为想让机器人真干活,得先让它学会不摔坏自己——而这件事只能先在虚拟世界里试:真机上摔一次,零件要修,时间搭进去。现实的做法,是让机器人在虚拟场景里先跑几万遍,练熟了再上真机。机器人,就是世界模型最大的考场。
Atlas 的模拟能力就是冲这个去的。官方管这套流程叫「从真实到模拟」:拿手机拍几段视频,就能给机器人搭一个训练场。
钱也往这儿跑。World Labs 累计融资约 12 亿美元,英伟达、AMD 都在投资人名单里。谷歌、英伟达自己也在做同类模型,国内阿里、腾讯同样在给机器人造世界模型。自动驾驶公司也用上了这套路:用世界模型生成路上很难遇到的危险场面,让车先在虚拟里撞明白。
谁先把会「想世界」的 AI 做出来,谁就握着机器人的考场钥匙。
说句我的判断:方向对,路还长。
会画的 AI 走到今天用了好几年,会想世界的 AI 现在才刚睁眼。Atlas 是重要一步,但「世界模型」这四个字,眼下更多是目标,不是成就。别把官方演示当量产货,也别急着给这条路判死刑。有人为它吵、为它砸钱,本身就说明这事值得争。
画得像,是上一题;想明白世界,是下一题。
来源

- World Labs 官方博客:《Atlas: A World Model for Spatial Intelligence》
- David Ha 与 Jürgen Schmidhuber 论文:《World Models》
- OpenAI 论文:《Video Generation Models as World Simulators》(「世界模拟器」标签出处)
- Tom’s Guide:关于 OpenAI 视频生成模型下线的报道
- 李飞飞 TED 演讲:《With spatial intelligence, AI will understand the real world》(对应「黑暗-眼睛」意象与「空间智能」方向)
- 李飞飞:《From Words to Worlds: Spatial Intelligence is AI’s Next Frontier》(Substack;「语言是有损低带宽通道」「黑暗里摸字的人」的出处)
- The Decoder:LeCun 关于视频生成路线的评论(二手转引)
- 智东西:World Labs 融资报道