Vault

AI教母谈工作、机器人与世界模型的未来

摘要

本期节目中,"AI教母"李飞飞(Dr. Fei-Fei Li)分享了现代人工智能从寒冬到爆发的完整历史脉络,以及她对AI未来的深刻洞见。她回顾了ImageNet(大规模图像数据集)如何成为点燃深度学习革命的火种——大数据、神经网络与GPU(图形处理器)三大要素的组合至今仍是现代AI的核心配方。她区分了"通用人工智能"(AGI)作为营销术语与科学追求的差异,指出当前AI在空间理解、创造性抽象和情感智能等方面依然远逊于人类。作为World Labs(世界实验室)的联合创始人,她详细阐释了世界模型(World Model)与空间智能(Spatial Intelligence)的概念,并介绍了刚刚发布的Marble产品——全球首个能从文字或图片直接生成可探索3D世界的生成模型,其应用已覆盖影视特效、游戏开发、机器人模拟训练甚至心理学研究。此外,她还分享了从学术界到创业的转型心得、对人本AI(Human-Centered AI)的长期承诺,以及一个核心信念:无论你从事什么职业,每个人都在AI时代拥有自己的角色。

正文

一、"AI毫无人工可言"——一位人文主义者的技术观

李飞飞被《连线》杂志称为"为数极少、一张厨房餐桌就能坐下的、真正推动了AI近期惊人进步的科学家群体之一"。人们称她为"AI教母",但她坦言自己并非乌托邦主义者:"我清楚地知道,AI不会对就业和人类毫无影响。但我是一个人文主义者(humanist),我相信AI能做什么、未来会怎样,取决于我们,取决于人。"

她把技术看作文明演进的一部分——从几千年前的文字记录到今天,人类一直在创新工具、改善生活。AI是这一进程的延续。这正是她乐观的来源。但她同时强调:"每一项技术都是一把双刃剑。如果我们作为社会、作为个体不做正确的事,我们也可能把这件事搞砸。"

她曾在国会作证时说:"AI毫无人工可言——它受人启发、由人创造,而最重要的是,它影响人。"这句话几乎是她整个职业生涯的信条。每当有学生从她的实验室毕业,她都会提醒他们:"你们的领域叫人工智能,但它一点都不'人工'。"

这些观点背后是她对AI领域近三十年的亲身参与。她认为,负责任地参与AI的发展与应用——不管你身处哪个环节——是每一个人最重要的第一步。"今天每个人都应该关心AI,因为它将影响你的个人生活、你的社区、整个社会以及下一代。"

二、从AI寒冬到ChatGPT:一段鲜为人知的历史

对大多数人来说,AI是在ChatGPT于2022年底横空出世时才进入视野的。但李飞飞指出,AI的旅程可以追溯到上世纪40年代图灵(Alan Turing)提出的那个大胆问题:"是否存在会思考的机器?"真正作为学科诞生则是在1956年的达特茅斯研讨会(Dartmouth Workshop),由后来到斯坦福任教的约翰·麦卡锡(John McCarthy)首创了"人工智能"这一术语。

从上世纪50年代到80年代,AI经历了基于逻辑系统、专家系统以及早期神经网络的探索期。随后大约二十年(80年代末到21世纪初),AI进入了机器学习(Machine Learning)时代——这是计算机编程与统计学习的联姻。这个结合带来了一个关键洞见:纯规则程序无法涵盖人类认知的全部能力,我们必须让机器自己从模式中学习。就像你给机器看三只猫,它不应只能认出这三只,而要能够认出第四只、第五只以及所有其他的猫。

李飞飞恰恰在2000年进入了这个领域,在加州理工学院(Caltech)开始了她的博士生涯。那时候正是所谓的"AI寒冬"——公众不关注、经费有限,但思想的暗流一直在涌动。正是那段艰苦岁月中,她做出了两个影响深远的选择。

三、ImageNet与深度学习的黎明:三大要素的"黄金配方"

第一个选择是她决意从视觉智能(Visual Intelligence)的视角切入AI。"人类是深度视觉动物。我们的大量智能建立在视觉、感知和空间理解之上,而不仅仅是语言。"她把物体识别(Object Recognition)定为"北极星问题"(north star problem),因为人类是在物体层面与世界互动——你想端起茶壶时,不会把它分解成一百片瓷器来处理,而是把它看作一个整体。

第二个选择更为关键。她和学生在2006-2007年间观察到,无论研究哪种数学模型——神经网络、贝叶斯网络或其他——都存在一个共同的痛点:这些模型没有足够的数据来训练。她意识到,人类学习和进化本质上就是大数据的学习过程。于是ImageNet项目诞生了。

这是一项极其大胆的尝试:从互联网上精心筛选1500万张图片,构建包含22,000个概念的分类体系(借用了语言学领域的WordNet词库结构),并将其开源给研究社区,还发起了每年一度的ImageNet挑战赛(ImageNet Challenge)。

转折点出现在2012年。多伦多大学杰弗里·辛顿(Geoffrey Hinton)教授带领的团队参加了ImageNet挑战赛,他们使用ImageNet提供的大数据、两台英伟达(NVIDIA)游戏GPU,成功训练出第一个在物体识别上取得重大突破的神经网络——AlexNet。"大数据、神经网络和GPU这三大技术的组合,成为现代AI的黄金配方。"

她特别指出,这个配方至今仍在驱动最前沿的AI。ChatGPT的技术基石同样是这三样东西:互联网规模的数据(主要是文本)、比2012年复杂得多的神经网络架构,以及多了无数倍的GPU。Scale AI创始人Alex Wang早年还曾多次给她发邮件,告知ImageNet对Scale的启发。

还有一个有趣的细节:2015到2016年间,硅谷一些科技公司还刻意避免使用"AI"这个词,因为不确定它是否是个"脏词"。李飞飞回忆,当时反而是她在鼓励大家使用这个词——"对我来说,这是人类在科学和技术探索中提出的最大胆的问题之一。"大约到2017年,硅谷才逐渐有公司开始自称"AI公司"。不到十年后,你已无法找到一家不自称"AI公司"的科技企业了。

四、"AGI更像一个营销术语"——关于通用人工智能的冷静思考

面对"AGI(通用人工智能)何时到来"这个被反复追问的问题,李飞飞给出了科学家式的诚实回答:"作为一个科学从业者,我对科学非常认真。我进入这个领域就是被'机器能否像人一样做事情'这个大胆问题所激励的。对我来说,这就是AI的北极星。我不清楚AI和AGI有什么区别。"

她指出,AGI的定义从未统一——从"赋予机器某种超级能力"到"机器能在社会中成为经济上可行的智能体",众说纷纭。她坦言:"AGI更像一个营销术语,而非科学术语。如果图灵今天还活着,你让他对比AI和AGI,他大概会耸耸肩说,'我在1940年代问的就是同一个问题。'"

但这并不意味着她对当前AI的能力感到满足。相反,她认为AI还有巨大的创新空间。一个生动的例子是:"你让一个模型观看一段办公室视频然后数一数椅子数量——这是一个幼儿或小学生都能做到的事,今天的AI却做不到。"更深层地说,牛顿能从天体运动中推导出万有引力方程的那种创造性、外推和抽象能力,以及教师在办公室与学生交流时那种细腻的情感与认知智能,今天的AI都远无法企及。"我们才刚刚触及表面。"

五、世界模型与空间智能:AI的下一个前沿

"我一生都在思考如何推动AI向前发展。GPT-2出来的时候(2020年底),公众还没有意识到大语言模型的能力,但我们作为研究者已经看到了未来。然而我来自视觉智能的世界,我一直在想,在语言之外,我们还有太多可以推进的方向。"

她用一个具体场景阐释了这个想法:"想象一个混乱的第一响应者现场——火灾、交通事故或自然灾害。你沉浸其中,看着人们如何组织救援、阻止灾情蔓延、扑灭大火。这其中大部分是运动、是对物体和世界的自发理解、是人类的情境感知。语言是其中一部分,但在很多情境下,语言本身并不能帮你扑灭火焰。"

这就是空间智能(Spatial Intelligence)与"世界模型"(World Model)的内涵。李飞飞将连接视觉智能与具身AI(Embodied AI,即机器人学)的关键纽带定义为:理解世界的空间感。2022年起,她基于在机器人学和计算机视觉领域的多年研究,开始系统性地阐述这一理念。2024年,她在TED演讲中正式向公众介绍了空间智能与世界模型。

2024年,她与三位联合创始人——Justin Johnson、Christoph Lassner和Ben Mildenhall——共同创立了World Labs(世界实验室)。公司名称中的"World"正是他们核心理念的体现。她的定义简洁有力:"世界模型是一个基础,你可以用它来推理(reason)、交互(interact)和创造(create)世界。"

关于世界模型如何超越语言模型,她举了一个绝妙的例子——DNA双螺旋结构的发现史:罗莎琳德·富兰克林(Rosalind Franklin)拍下的X射线衍射照片只是一张平面的二维图像。但沃森和克里克能够凭借人类的3D空间智能,从这张平面图像中推导出DNA的三维双螺旋结构。"你不可能在二维思维中推导出那个结构。你必须用3D空间思维。所以说,即使在科学发现中,空间智能或AI辅助的空间智能也至关重要。"

六、Marble:全球首个"文字即世界"产品

2025年底,在节目播出同期,World Labs推出了Marble——全球首个能通过文字或图片提示直接生成可导航、可交互的3D世界的产品。李飞飞透露,团队花了超过一年时间攻克"让生成模型输出真正3D世界"这一极其困难的技术难题。大约一两个月前,他们第一次看到模型能够通过一句话、一张或多张图片就创造出可以自由漫步的世界。

"我们把这种能力称为Prompt to Worlds(从提示到世界)。"目前团队约30余人,以研究人员和研究工程师为主,同时也配备了设计师和产品人员。

产品中有个意外的设计亮点:为了引导用户进入生成的世界,工程师们设计了一个"点点"过渡效果——用户可以短暂地看到构成世界的点云结构,然后纹理才会渲染完毕。李飞飞说:"很多用户告诉我们这个体验有多令人愉悦。这并非大模型本身的功能,而是一个有意为之的可视化特性,听到用户们这么喜欢,我们非常满足。"主持人将这种体验比作《黑客帝国》(The Matrix)中经典的绿色代码瀑布镜头。

关于应用场景:

  • 影视虚拟制作:团队与索尼合作,用Marble生成的3D场景拍摄了产品发布视频。据参与的技术艺术家和导演反馈,"这将制作时间缩短了40倍"。因为项目只有一个月时间,而需要拍摄的内容非常多,Marble大幅加速了视效与电影制作的虚拟制片流程。

  • 游戏开发:用户可以将Marble场景导出为网格模型(mesh),直接用于VR游戏或自研游戏。

  • 机器人仿真训练:为机器人创建多样化的合成训练数据一直是研究者的痛点。传统方式是人工为每一个训练资产建模,极为耗时。Marble几乎可以瞬间生成大量不同的环境和可操作物体,已有研究者主动联系团队希望将其用于仿真场景构建。

  • 心理学研究:一个意料之外的应用来自心理学家团队。他们研究精神疾病患者的脑部对不同沉浸式场景(如整洁vs.凌乱的环境)的反应,但自行创建这些沉浸式场景既昂贵又耗时。Marble能够即时生成大量实验环境,让他们非常兴奋。李飞飞的一位朋友甚至在节目播出前夜打来电话,询问是否能用Marble进行恐高症的暴露疗法。

Marble与Sora等视频生成模型的根本区别在于,World Labs的核心理念是"空间智能的本质不仅仅是观看平面视频"。她引用柏拉图的洞穴比喻(Allegory of the Cave):被绑在洞穴中的囚徒看着墙上的投影,他的任务是理解墙壁背后真实的3D/4D世界。空间智能正是"从2D信息中理解、创造、推理和交互于深层空间世界"的能力,而不仅仅是被动观看。

七、机器人学的"苦涩教训":为什么这条路比语言模型更难

当被问到与知名投资人克里斯·迪克森(Chris Dixon,a16z合伙人、World Labs的投资方)建议的话题时,李飞飞深入探讨了理查德·萨顿(Richard Sutton,2024年图灵奖得主)提出的"苦涩的教训"(The Bitter Lesson)在机器人学中的适用性。

"苦涩的教训"的核心论点是:回顾AI算法发展的历史,简单的模型配合海量数据最终总是胜过复杂的模型配合少量数据。李飞飞笑着说:"对我来说这不是苦涩的,这是甜蜜的教训。这正是我创建ImageNet的原因。"

但在机器人学中,这条法则面临独特的挑战:

  1. 数据获取的困难:语言模型的训练数据和期望输出都是文字/Token(词元),两者完美对齐。但机器人需要输出的是3D世界中的行动,而现有的大量网络视频数据恰恰缺乏这些3D行动信息。"我们有点像在把方钉塞进圆孔。"

  2. 物理系统的复杂度:"机器人更接近自动驾驶汽车,而不是大语言模型。"这意味着不仅需要"大脑",还需要物理机身和应用场景。她以自动驾驶的发展为对照:从2005年斯坦福在DARPA挑战赛中胜出、一辆自动驾驶车在内华达沙漠行驶130英里,到今天的Waymo在旧金山街头运营,整整花了20年,而且"还没完全搞定"。自动驾驶车本质上只是"在2D平面上移动、目标是不要碰到任何东西的金属盒子",而机器人是"在3D世界中运行,目标恰恰是要触碰东西"。这个旅程将漫长得多。

不过她同时强调,深度学习正在加速机器人的"大脑"进化,世界模型的构建也将极大释放机器人所需的训练信息。她说:"正因如此,我才投身于机器人学和空间智能,我也对此无比兴奋。"

八、无畏之心:从学者到创业者的跨越

当被问到创立公司一年半以来最深的感悟时,李飞飞坦率地承认:她低估了AI领域竞争的激烈程度。"无论是从模型技术本身,还是从人才争夺来看,这种竞争都激烈得让我有时会陷入偏执。"她没有预料到某些人才的成本会有多高。

但她认为自己相比20岁的创业者,对这段"艰苦的研磨之路"更有准备。毕竟,她19岁开过干洗店,后来在谷歌创立了Google Cloud AI,在斯坦福联合创立了人本AI研究院(HAI)。她在职业生涯中的每一个重大选择,都源于一种特质——"智识上的无畏"(intellectually fearless)。

  • 放弃普林斯顿终身教职来到斯坦福:重启终身教职时钟(Tenure Clock),因为在那个时刻,斯坦福的人和硅谷生态太吸引人了。

  • 成为SAIL(斯坦福人工智能实验室)的第一位女性主任:当时她作为相对年轻的教授,没有花太多时间考虑失败的可能。

  • 加入谷歌:因为想和杰夫·迪恩(Jeff Dean)、杰弗里·辛顿等顶尖人物一起工作。

  • 创立World Labs:同样的使命感驱动。

她给年轻AI从业者的建议非常直白:在决定职业选择时,不要把每一个细枝末节都放进方程式里反复计算。最关键的问题是:"你的热情在哪里?你认同这个使命吗?你信任这个团队吗?"去关注你能产生的影响、你能与之共事的团队,而不是每时每刻都在计算哪个公司在FOMO的浪潮中看起来"会赢"。

九、斯坦福HAI:架起硅谷与华盛顿之间的桥梁

2018年,李飞飞在谷歌的学术休假即将结束时,面临一个重要抉择:留在工业界还是回到学术界。在谷歌的经历让她深刻意识到,AI将是"文明级的技术"(civilization-level technology)。她在《纽约时报》发表文章,呼吁建立一个以人类福祉和以人为本为核心的AI发展指导框架。

这就是斯坦福人本人工智能研究院(HAI,Human-Centered AI Institute)的由来。她与约翰·埃切门迪(John Etchemendy)教授、詹姆斯·兰迪(James Landay)教授、克里斯·曼宁(Chris Manning)教授等共同发起,将HAI定位为"人类历史上最大的人类中心AI研究机构"。六七年后的今天,HAI已涵盖斯坦福全部八大学院的数百名教授——从医学到教育,从可持续发展到商学,从工程学到人文学科和法律。

HAI的一个独特贡献是架起了硅谷与政策制定者之间的桥梁。李飞飞回忆:"当我们创立HAI时,硅谷几乎不和华盛顿特区、布鲁塞尔或世界其他地方交流。"HAI发起了国会训练营、AI指数报告、政策简报会等多种形式的项目,积极参与了包括推动首个国家AI研究云法案(在特朗普第一任期内通过)和参与州级AI监管讨论在内的政策制定。

十、每个人都在AI时代有自己的角色

在访谈的结尾,李飞飞回应了她最常被问到的问题:"如果我是音乐家、中学老师、护士、会计或者农民,我在AI中有角色吗?还是AI将接管我的生活和工作?"

她的回答斩钉截铁:"这是一个响亮的'是'。每个人都有角色。"

"如果你是一位年轻的艺术家,热爱讲故事,请拥抱AI作为工具——拥抱Marble。你讲故事的方式是独一无二的,世界仍然需要它。但如何用最不可思议的工具以最独特的方式讲述你的故事,这很重要。你的声音需要被听到。"

"如果你是一位即将退休的农民,AI依然与你有关。你是一个公民,你可以参与你的社区,你可以对AI如何被使用、如何被应用发出自己的声音。"

"如果你是一名护士,我希望你知道,在我的整个职业生涯中,我在医疗健康研究上投入了大量精力,因为我相信我们的医护人员应该被AI大大增强和辅助——无论是提供更多信息的智能摄像头,还是机器人辅助。我们的护士过度劳累、极度疲劳,而随着社会老龄化,我们需要更多帮助来照护人们。AI可以扮演那个角色。"

她总结道:"硅谷的我们习惯于随意抛出'无限生产力''无限休闲时间'或'无限力量'这样的词。但归根结底,AI关乎的是人。任何技术都不应剥夺人的尊严。人的尊严和自主性应该处于每一项技术的开发、部署和治理的核心。"


相关链接:World Labs 官网 worldlabs.ai,Marble 产品体验 marble.worldlabs.ai

觉得有用?分享给一个需要的朋友 🙏