李飞飞“世界模型”三分类体系与十大观点

本文转载于“小兵研究”;如有侵权,请联系站务删除!

李飞飞世界模型三分类体系:一场AI概念的重构与再定位

引言:一个词语,三个世界

2025年至今,AI领域被一个词搅得沸沸扬扬——“世界模型OpenAISora被称作世界模拟器,谷歌的Genie让用户在生成的画面里自由探索,NVIDIA宣称Omniverse是世界模型的基础设施,各大机器人公司争相将自身产品贴上世界模型的标签,甚至连传统游戏引擎也被拖入了这场叙事。大家用着同一个词,说的却完全不是同一件事。

正是在这片喧嚣之中,斯坦福大学教授、World Labs联合创始人兼CEO李飞飞,联合团队于202664日发表了题为《世界模型的功能分类:渲染器、模拟器、规划器,以及连接它们的循环》的长文,系统性地为这一被严重滥用的概念建立起清晰的分类体系李飞飞直言,世界模型是当今AI领域最重要、也最被过度使用的术语之一——视频生成模型、语言模型、物理引擎,统统被装进了同一个名叫世界模型的筐里

本文系统梳理李飞飞提出的三类世界模型划分,深入阐释每一类的定义、特征、技术路径与产业价值,在此基础上整理归纳李飞飞对AI未来发展路径的核心十大观点,并对三类模型之间的内在关联、融合趋势与终极形态作出深度解读。

一、分类的理论地基:POMDP闭环与三类投影

要理解李飞飞的三分类,首先需要回到一张比所有现代AI技术都更古老的示意图。

几十年来,强化学习教科书都使用同一幅图的变体来描述智能体如何与世界交互,其正式名称为部分可观测马尔可夫决策过程POMDP。这一框架描述的是一个简洁而精妙的闭环:智能体采取行动,行动改变世界的状态,智能体通过观测感知变化,再依据观测采取下一步行动

李飞飞对状态观测这两个概念做了精确区分:状态是物理学和机器人学意义上的概念,是对某一时刻世界中正在发生的一切的完整描述,包括每一个物体、每一个位置、每一组速度和每一项属性;而观测则是智能体从现实中获得的局部视图——落在视网膜上的光子、传感器读数、视频帧中的像素。状态是世界的底层现实,但任何身处其中的智能体都无法直接看见它;观测是智能体对这一现实的投影,行动则是智能体据此作出的响应

正是在这个POMDP闭环的框架内,李飞飞提出了她的核心洞见:今天所有被冠以世界模型之名的各类系统,本质上都是这个闭环在不同方向上的投影,每一类只输出闭环中的一个片段分类的标准极其简洁——就看你输出的到底是闭环里的哪个部分:输出像素(观测)的是渲染器,输出状态的是模拟器,输出行动的是规划器

这一分类法的力量在于,它不再追问谁才是真正的世界模型这种本质主义的问题,而是将不同技术路径置于同一坐标系中比较:它们各自捕捉了世界的哪一个侧面?它们各自的输出服务于什么目的?它们之间可以如何连接与融合?

二、第一类:渲染器——只会画皮的视觉魔术师

(一)定义与特征

渲染器是三类世界模型中商业化最成熟的一类。它的任务是输出供人眼观看的像素,核心评估指标是视觉逼真度。渲染器的契约纯粹是视觉上的——它并不对画面背后的物理结构承担任何责任。生成的是观众会看到什么,而不是现实本身是什么

(二)典型代表

将文本提示转化为电影级航拍镜头的视频生成模型属于渲染器。谷歌的Genie 3World Labs自研的RTFM等交互式生成系统也在此列。谷歌的相关模型已经将渲染级别的图像生成能力交付到数亿用户手中,渲染器成为商业化落地最快的一类世界模型

(三)核心能力与天花板

渲染器的核心能力是视觉合成与逼真度优化。它通过海量视频数据学习空间与时间的统计结构:光线如何落在表面上、物体在受力后会如何运动。但它存在一个根本性局限——渲染器优化的是看起来对,而不是实际上对

李飞飞举了一个极具说服力的例子:AI生成的航拍镜头中,建筑从上方看可能完美无缺,但如果试图驱车穿过下方的城市,画面就会分崩离析,楼宇结构暴露各种错误——因为渲染器并不理解三维空间结构,它只还原了观看者会看到的画面,而非事物本身的真实构造。输出再精美,也不能拿来做建筑设计,更不可能训练一个需要在真实环境里精准操作的工业机器人

渲染器的本质缺陷,在于它困在表象的层次上,从未触及世界的本质结构。它的输出固然美丽,但你无法信任它们去承担那些与现实世界紧密结合的任务。 这是理解李飞飞整套分类体系时首先必须认清的一点。

三、第二类:模拟器——被严重低估的物理引擎

(一)定义与特征

模拟器是李飞飞论述中的关键枢纽,也是三类模型中最受关注最少、却最深具产业价值与最棘手技术难题的一类。模拟器输出的不是像素,而是状态——一种在几何、物理和动力学层面高度保真的世界表征

模拟器的契约是结构性的:几何必须经得起审视,物理必须尊重客观规律,动力学表现必须符合现实约束。它不追求好看,而是追求正确。模拟器输出的几何数据、材质参数、碰撞网格这类信息,对普通观众而言可能没有任何好看的东西,但正是它们构成了数字世界的地基和承重墙

(二)典型代表

模拟器同时服务于两类用户:一是建筑师、设计师、影视和游戏开发者,他们需要的不是视觉效果的炫酷,而是超越表面的精确数据;二是强化学习智能体、机器人控制器、自动驾驶算法等程序,它们需要一个安全、可控的环境来大规模训练,复现那些现实中太危险、太昂贵或者根本没法实测的场景

英伟达的Omniverse仿真平台是模拟器方向的代表,它瞄准的工厂、仓库、数字孪生、供应链等市场,潜在规模超过万亿美元。机器人训练、自动驾驶测试、建筑可视化、工程设计、药物发现等各行各业,都需要某种形态的模拟技术。李飞飞自己的World Labs做的也正是模拟器方向——其产品Marble接收文本、图像或草图输入,生成可自由漫游的3D环境,同时输出用于视觉呈现的高斯泼溅数据和用于物理计算的碰撞网格

(三)为何模拟器是关键枢纽

李飞飞用一个极其精炼的比喻讲透了三者的关系:如果把世界模型比作盖楼,渲染器是外立面,规划器是动线,模拟器才是地基和承重墙。更深入地说,语言是对世界的抽象,像素是对世界的投影,而几何、物理和动力学,才更接近世界本身

这正是模拟器被称为关键枢纽的原因:掌握了模拟,既可以向上投射成像素供给人眼看,也可以向下推导成动作后果供机器人使用。一个真正具备底层理解的世界模型,如果理解了杯子的几何、材质和受力,就应该能够:从任何角度渲染它,模拟它被推倒后会发生什么,也能规划一只手把它拿起来——三种能力共享同一套底层理解。反过来却不成立:只会渲染或只会规划,都不一定做得到另外两件事

(四)模拟器面临的四大技术挑战

尽管模拟器的战略价值极高,但其技术难度同样巨大。李飞飞精准指出了四大核心挑战。

其一,三维数据稀缺。 训练模拟器需要带有精确几何和物理标注的三维数据,这种数据的规模相比训练渲染器所使用的互联网视频,稀缺了好几个数量级。这是物理世界的AI进展远慢于语言模型的核心瓶颈之一。文本数据是清晰、语义明确的,而物理世界的像素和体素充满了噪声,且难以大规模获取

其二,仿真到现实的鸿沟 仿真环境里物体的运动规律与真实世界始终存在差距,任何一个试图将仿真中训练好的策略迁移到物理世界的实践者都深知这一困难的切肤之痛

其三,生成式仿真的几何隐患。 生成式AI给模拟带来了新问题——AI生成的几何体表面可能看起来没问题,但内部暗藏面重叠、尺寸不对、拓扑错误等缺陷,一旦送进物理引擎计算,结果就会变得荒谬

其四,多物理场仿真的超高计算成本。 同时模拟刚体、柔体、流体和织物的相互作用,计算成本比单一领域的模拟高出好几个数量级

这些挑战的叠加,使得模拟器成为三类世界模型中最硬的一块骨头。但也正因为它的技术壁垒最高、产业价值最大,才成为李飞飞以及World Labs押注的核心战场。

四、第三类:规划器——机器人的行动大脑

(一)定义与特征

规划器输出的是行动——当接收到观测画面和目标后,它能直接告诉智能体(如机器人)下一步该做什么。规划器将感知(看到什么)与行动(该做什么)连接起来,是智能体从被动观测走向主动干预的桥梁。

视觉-语言-行动(VLA)模型就属于规划器这一类别。这类模型让机器人能够理解自然语言指令、识别当前场景状态,并输出具体的控制动作,完成诸如把杯子拿起把门打开之类的任务。

(二)现状与挑战

规划器的前景最令人兴奋,但现状也最令人警醒。李飞飞直接点明了问题所在:几乎所有演示都局限于严格受控的实验室环境。没有一个在真实部署的复杂度上被验证过。从实验室demo到真正能干活,中间隔着巨大的鸿沟

规划器面临的核心瓶颈与模拟器一脉相承:数据问题首当其冲。具身智能体在真实世界中交互产生的数据极为昂贵且难以规模化,而仿真数据虽然可以大量生成,但又面临仿真到现实的鸿沟”——在仿真中训练好的规划策略到了真实环境中往往表现大打折扣。此外,规划器还需要处理真实世界的不确定性、部分可观测性以及长时程任务的规划与推理问题。

(三)商业逻辑与未来想象

尽管困难重重,但资本和产业界对规划器的押注最为汹涌。李飞飞注意到一个现象:在过去18个月里,超过100亿美元资金流入了世界模型与机器人AI公司中,而一个值得注意的规律是,使用世界模型的公司所获得的融资规模,甚至超过了专门构建世界模型本身的公司。这既说明了市场对规划器领域的热切期待,也折射出这一赛道距离成熟商用仍有漫长道路要走。

在李飞飞的判断中,规划器一旦突破,整个行业将迎来能在厨房、仓库或手术室中可靠工作的通用机器人。这也正是她将规划器认定为三类模型之一的原因——它不是可有可无的锦上添花,而是让智能体从看世界走向改变世界的关键出口。

五、三类模型的关系与融合趋势

(一)共用同一套底层知识

李飞飞反复强调一个关键论断:三类模型并非从根本上彼此割裂。它们共享同一套关于世界如何运作的底层知识——几何、物理、动力学这种共享的底层理解,正是世界模型一词中世界二字的实质内涵:不是随意的数据分布,而是具有内在一致性的物理规律和空间结构。

这一论断的意义在于,它打破了渲染器、模拟器、规划器被视为独立技术路线的传统认知,提示研究者应该从整体视角思考世界模型的构建:好的世界模型不应只擅长渲染、只擅长模拟或只擅长规划,而应当具备从同一套底层理解中灵活切换多种输出形式的能力。

(二)三条线正在合并

李飞飞观察到当前最重要的技术趋势:三类模型的边界正在不断消融。渲染器开始接受动作输入,模拟器越来越可控,规划器也从反应走向深思熟虑。三条分别撑起数十亿乃至数万亿美元想象空间的技术路线,正在从独立项目走向同一件事。

World Labs的产品Marble正是这一融合趋势的先行实践者。它同时输出用于视觉呈现的高斯泼溅数据和用于物理计算的碰撞网格,率先将渲染器和模拟器统一到一个模型中。而随着规划的模块逐渐并入,一个更完整的融合框架正在浮现。

(三)终极形态:统一的世界基础模型

李飞飞描绘了技术演进的终极愿景—“终点是一个统一的世界模型:一个基础模型,既能渲染照片级真实视图,又能生成物理准确的结构,还能规划行动序列,并根据下游需求在不同输出模式之间切换。

这意味着未来的世界模型将不仅是三类模型的简单拼接,而是在同一套模型架构中找到平衡各类需求的最优解。在同一套架构中平衡各项需求,是当前世界模型领域最核心的攻关课题。 这是一条技术难度极高但战略意义极其深远的道路。

六、核心观点整理:李飞飞关于AI发展的十大洞见

基于对李飞飞近期一系列长文、访谈和演讲的全面梳理,可以将其核心观点归纳为以下十大洞见:

观点一:世界模型是当前AI领域最重要也最被滥用的术语之一。 各领域冠以世界模型之名所指的内涵截然不同,亟需精准定义。李飞飞率先提出的渲染器模拟器规划器三功能分类体系,为消除概念混淆提供了清晰的分析框架

观点二:世界模型的定义应回归强化学习中POMDP框架的技术本源。世界模型本质上是智能体行动状态观测这个交互闭环的不同投影。分类的标准就看你输出的是闭环中的哪个环节:渲染器输出观测值(像素),模拟器输出环境状态,规划器输出智能体动作

观点三:三类世界模型的功能定位截然不同,商业成熟度各异。渲染器商业化最成熟但能力有天花板(好看不等于物理准确);规划器最令人兴奋但离真实部署最远(实验室demo与实际可用之间鸿沟巨大);模拟器受关注度最低,却是衔接二者的关键枢纽核心支柱

观点四:模拟器是三类模型中被最严重低估、却又最深具产业价值的一环。模拟器工作于几何、物理和动力学层面,既能向上投射为像素供人类消费,也能向下推导出动作后果供机器人使用。掌握了模拟,就同时拥有了渲染和规划的基础;反过来则不成立

观点五:模拟器面临四大核心技术挑战——三维数据稀缺、仿真与现实的域差、生成式仿真的几何隐患、多物理场仿真的高算力成本。 这些挑战的叠加,使得模拟器成为三类模型中最难啃的骨头,但这些困难也恰恰是其最高技术壁垒的来源

观点六:三类模型共享同一套底层知识(几何、物理、动力学),当前最重要的发展趋势是三者边界不断消融、走向融合。 渲染器开始接受动作输入,模拟器越来越可控,规划器从反应走向深思熟虑。融合是必然方向,而非不同技术路线之间的零和博弈

观点七:技术演进的终局是能根据下游需求灵活切换输出形式的大一统世界基础模型。在同一套模型架构中平衡渲染、模拟和规划三类需求,是当前世界模型领域最核心的攻关课题。统一世界模型将从根本上重塑机器智能与其所处物理世界之间的关系

观点八:世界模型与空间智能相辅相成。 空间智能是AI的下一个前沿——它赋能AI拥有故事讲述者的想象力、第一反应者的行动力以及科学家的空间推理精度。而世界模型正是解锁空间智能的必经路径。真正具备空间智能的世界模型必须具备生成性(Generative)、多模态性(Multimodal)和交互性(Interactive)三大能力

观点九:大语言模型无法通往AGI李飞飞从生物进化的宏观视角出发,指出语言在生物进化史上只是最近50万年的产物,而视觉与触觉所代表的空间智能早在5亿年前的寒武纪就开启了演化竞赛。AI若无法理解三维物理世界、不具备物理直觉,就将被永远困在数字的像素之中

观点十:AI的终局是成为新的电力”——赋能文明的基础设施。 李飞飞将AI比作一百多年前的电力:电力的成功不是因为建立了庞大的电网,而是因为它点亮了学校的灯、驱动了工厂的机器、延长了人类的寿命。同理,AI的成功不在于模型参数有多大,而在于它能否赋能每一个体、每一种创造力、每一个行业。世界模型的终极意义,是让机器真正理解世界,从而更好地服务于人类

七、结语:从概念澄清到范式重塑

李飞飞这次对世界模型概念的集体辟谣,远不止是一次术语的校正,更是一次对AI未来发展方向的深度思考与战略布局。