李飞飞:语言之后,AI要学会用"身体"理解世界
单击上方“图灵人工智能”,选择“星标”公众号
您想知道的人工智能干货,第一时间送达


李飞飞(Fei-Fei Li)——斯坦福大学教授、斯坦福以人为本人工智能研究院(Stanford HAI)联合创始人、美国国家工程院与国家医学院两院院士、空间智能公司 World Labs 创始人兼CEO——在本届AASF Summit上,与长期担任CNN、NBC News、MSNBC主播及记者的资深新闻人Richard Lui展开了一场炉边对话。开场由AASF联合主席、李飞飞多年的同事与合作者Kai Li介绍登场:他回忆起当年协助李飞飞打磨早期立项申请的一段往事——彼时几乎没有评审相信"标注图片"这件事值得资助,而后来的故事,所有人都知道了:那批被标注的图片,后来长成了ImageNet,也悄然改写了这个时代。
我不想做声音最大的那个人
被问及为什么愿意在世界各地的舞台上谈AI,李飞飞的回答是:这一次,她想坐下来,和真正的思考者、学生与行业领袖认真聊一聊。她开玩笑说自己大概是"最无聊的AI演讲者",因为她拒绝迎合极端修辞——立场越极端、声音越两极,能换来的镜头就越多。但她说,作为一名科学家,也作为一名连续创业者,她更愿意站在这场技术变革"混乱的中间地带"发声:AI作为一项文明级技术,既拥有巨大的力量,也直接冲撞着人类自身最复杂、最不完美的那一面——技术越强大,遇上的人性越复杂,中间地带的张力就越大,而这恰恰是问题真正发生、也最需要被认真讨论的地方。她说,2026年的今天,全球公众都需要更负责任、更细致的对话,而任何手握"麦克风"的人——记者、创业者、演讲者——都对此负有一份责任。
从一张标注图片,到"这不再只是好奇心"
回顾自己的科研生涯,李飞飞说,她和她那一代人最初投身AI,靠的是纯粹的好奇心——彼时这既不是热门方向,也算不上一份"铁饭碗"式的职业选择。她提到,很多人把2012年视为AI发展史上的"ImageNet时刻"——那一年,基于她此前主导构建的ImageNet大型图像数据库,深度卷积神经网络在图像识别竞赛中取得突破性胜利,成为后来深度学习浪潮公认的起点之一。但她自己真正的个人转折点,出现在2017至2018年——她当时短暂加入谷歌云,第一次近距离看到机器学习正在真实、多样的行业场景中落地。也是从那一刻起,她意识到这已不再是个人的科研兴趣,而是一项深刻影响社会各个角落的文明级技术。她说,这段经历把她从一名单纯追随好奇心的科学家,变成了一名主动承担社会责任的科学家。
下一道难题:给AI装上"眼睛"之外的能力
被问及正在攻坚的下一个大问题,李飞飞的回答是:把AI的智能疆域从语言,推向空间与物理世界。用大白话说,今天的大语言模型很会"说",却几乎不会"做"——它读不懂一个房间的布局,也无法伸手扶稳一杯水。李飞飞援引演化的逻辑来解释为什么这件事重要:在人类语言诞生之前,动物早已凭借空间与物理智能,在真实世界中娴熟地感知、导航与操控。她认为,一旦这种能力被机器掌握,潜在价值将极为广阔——从加速科学发现,到自然灾害救援、危险环境探索,再到制造业与农业自动化。她也提到自己身为多位年迈父母与病患照护者的亲身经历,深知人类在体力照护上要承受的巨大负担,而这正是空间与物理智能有望切实缓解的现实痛点之一。
"世界模型"忽然人人在谈——但它到底是什么
李飞飞坦言,这一领域的进展正在加速:2024年她与团队开始深耕这个方向时,全世界的注意力还大多停留在语言模型上;而到2026年的今天,几乎人人都在谈论"世界模型",甚至就在两个月前,她还写了一篇技术博客,专门厘清这个被过度使用、各说各话的词到底该如何定义。她指出,"世界"该如何界定,其实是个古老的争论——早在古希腊时代,人们就已在争论"世界"由何构成。为此,她提出了一套功能性的"3P"框架:第一层是渲染(Rendering)——让模型呈现出世界"看起来"是什么样子,今天流行的视频生成模型大多属于这一层,消费者主要是欣赏与创作内容的人类;第二层是仿真(Simulation)——不只是好看的像素,而是要如实还原世界的物理与动态规律,比如一杯水被打翻后会如何流动,这一层的使用者既包括人类(例如游戏玩家),也包括机器(例如用CAD仿真设计机械或在虚拟环境中训练机器人);第三层是规划(Planning)——不仅理解世界的结构,还要预测下一步该做什么,这直接关系到自动驾驶与机器人的决策。她强调,这三层功能正在加速融合:一个渲染足够精确的模型,往往也能催生高质量的仿真,进而支撑更好的规划,而语言模型的能力也正被越来越多地用来驱动传统的物理仿真器——这正是当前世界模型领域最活跃、也最令人兴奋的演进方向。
被数万亿美元低估的产业:护理
谈及机器人在医疗与护理领域的应用潜力,李飞飞说,这可能是她心目中最重要的落地场景之一:全世界没有一个国家的护士数量是充裕的,护理这份工作强度高、需求殷切,却长期人手紧张,而随着人均寿命延长,居家护理的缺口只会更大。她特别提到,这份负担在很大程度上由女性不成比例地承担着,而这部分无偿护理劳动的经济价值——仅在美国——她估算约为3万亿美元,却长期未被计入社会核算体系。换句话说,如果空间与物理智能能取得实质突破,机器人有望大规模缓解这一长期被忽视、却真实关系到千家万户的护理缺口。

比语言模型难上百倍:机器人到底卡在哪
对比语言模型与机器人的训练难度,李飞飞坦言,二者不在一个量级上——具体难多少倍,很难给出精确数字,但从多个维度衡量都相差悬殊。她解释说,语言是一种相对"干净"的模态:输入输出都基于数字世界的文本,且已有海量数据积累,无论是写代码还是做智能体,输入与输出之间的对应关系也相对清晰。而机器人所处理的,是一个自由度极高的三维物理世界,人类迄今为止积累的机器人交互数据极为稀少。她指出,目前唯一称得上"成熟"的机器人形态其实是汽车——一种自由度有限、本质上只需在二维平面上"不撞到东西"的系统,即便如此,也是历经上百年发展,并依靠特斯拉、Waymo这类公司多年积累真实驾驶数据,才走到今天。相比之下,真正的机器人需要在三维空间中以更高精度触碰、操作和改变世界,而行业目前既缺乏足够精良的传感器来采集这类数据,累积的数据规模与自动驾驶行业相比也相去甚远,更遑论与语言模型的数据体量相提并论。她也提到,业内正在探索通过第一人称(egocentric)视角视频等方式,采集人类双手在真实世界中操作的数据,并结合"视觉-语言-动作"(VLA)等新型模型架构进行训练,这类"人本数据"未来料将扮演重要角色——但她强调,这件事并非无解,只是难度极高,眼下正是无数研究者投身其中的原因。
真正稀缺的不是算法,是数据
被追问模型开发与数据积累哪个更难,李飞飞说这个问题很难切割,因为二者高度交织——但如果一定要给出答案,她认为数据更难获取。她感叹,即便在ImageNet发布十多年后的今天,数据依然是AI领域最容易被低估、却始终举足轻重的一环。
让她每天笑着醒来的,是那群"永远不会变老"的年轻人
被问到在实验室与团队中,最近有什么让她惊喜或会心一笑的瞬间,李飞飞说,真正让她保持活力、每天醒来都想工作的,是和一群充满热情、极具工匠精神的年轻技术人才共事——用双手把技术难题变成现实的建造者精神,一直刻在她心里。她说,自己整个职业生涯最大的特权,就是身边共事的人"永远不会变老"——他们总是二三十岁,而自己在变老,但和这些年轻的工程师、科学家一起工作,依然是她感到最快活、最有能量的事。她笑称,无论自己在哪个时区、哪个时刻醒来,团队的工作沟通软件永远有人在线。
好奇心与"来钱",从来不是单选题
面对年轻研究者与学生,李飞飞被问及她如何向他们传递这份"好奇心",同时又不让他们在商业压力面前迷失方向。她的回答是:这两者不必对立。在纯粹的高校环境里,尤其是博士生生涯的起步阶段,本就是一个受到充分保护、可以专注追随好奇心的阶段;但在创业公司的语境下,好奇心与商业价值之间的健康平衡则至关重要——为客户创造真正的经济价值,本身也需要好奇心,需要去理解客户真正的需求与痛点。她说,今天的AI行业集体讲述了一个宏大的故事,她也相信这个故事,但"车轮真正碾过地面"的时候,这份宏大叙事终究要落地为对个人和企业都实实在在的价值,而不只是停留在故事本身。
别再管什么都叫"AI加香蕉"了
谈到行业里"AI+一切"式的浮夸命名——从AI手机壳到AI水果贴纸,李飞飞的态度很直接:不管故事讲得多宏大,最终都要落回到脚踏实地解决真实问题上。她说,尤其是在董事会层面,每家公司都必须想清楚自己到底提供了什么价值:产品是什么、客户是谁、他们真正的痛点在哪里。在她看来,AI是一项能创造巨大价值的通用技术,但归根结底,重要的从来不是"AI"这个标签本身,而是它究竟解决了什么问题——这也是她希望传递给企业决策者们最朴素、也最重要的一句话。
当AI"越界":一场关于刹车与信任的比喻
Richard提到,就在过去三四周,新闻头条频繁出现"AI模型越出安全边界"一类的故事——不完全按照设定的约束行事。他问李飞飞,公众该如何理解这些报道,又该如何向下一代解释这件事。李飞飞的回答是:技术从来都是一把双刃剑,它是否危险,取决于是谁在用、为了什么目的而用;一些风险是被蓄意设计出来的,另一些则是意料之外的后果。她并不想淡化问题的严重性——具备智能体(agentic)能力的AI系统,尤其是在网络安全领域,确实可能被用来"优化"出真正的破坏力。但她强调,最终的责任在人类自己:是人类要决定如何治理它、管理它。她打了一个比方:今天世界上没有任何一家汽车厂商敢说"我们的刹车每周五都会失灵"——防止这一点根本不需要AI,只需要一套简单可靠的工程流程;但整个社会之所以敢放心买车、放心把刹车交给一套系统,靠的是几十年来建立起的集体信任、社会规范与行业护栏。AI之所以让人不安,恰恰是因为这些规范、护栏与公众认知,还没有跟上技术本身的速度——而这,正是她反复强调的"混乱中间地带":技术很新,能力已经展现,但社会该如何监管、如何建立信任,答案还在摸索中。她也坦言,作为一名科学家和教育者,她很担心一种倾向——每当话题一涉及AI,一部分声音立刻滑向最末日、最悲观的说辞;用耸动的故事去佐证某种立场,并不能真正帮助公众理解问题。
移民的旅程:不确定性教会她的事
被问及在身兼教授、创业者、女儿、照护者等多重身份的路上,家庭给了她怎样的教诲,李飞飞把答案带回了自己的移民经历。她说,自己或许和现场许多观众共享着同一种体验——作为移民,意味着要闯入一个新世界,学一门新语言,打破一种又一种边界,被迫变得有创造力、有韧性、懂得随机应变。她说,做科学家和做移民其实并不遥远:两者都意味着不断面对未知的新世界,不断直面不确定性,常常需要独自在一条看不到光的隧道里走很长一段路,才终于看到一点光亮。回忆起自己刚到美国、还是青少年、靠奖学金求学的日子,她说那时甚至不确定自己能否真的成为一名科学家——家里经营着餐馆和干洗店,全家都在"生存模式"里打转,成为科学家在当时更像是一种奢侈的想法。她说,如今作为创业者所感受到的不确定性,与当年如出一辙:没有人能保证成功,唯一能依靠的不是外界的关注或评价,而是韧性与信念本身。她也谈到,走进那些"自己看起来与众不同"的房间时,早年确实有过不被认真对待的时刻——但她说,自己后来做出了一个选择:把注意力放在自己真正热爱、真正有热情的事情上,而不是放在那些让自己气馁的事情上。她笑说,父母并不是常见印象里那种"虎爸虎妈":在新泽西为生存打拼的岁月里,他们没有多余的精力去规划她的人生,这反而给了她一种意外的自由——一种并非刻意给予、而是由生活的艰辛所馈赠的思想自主权。
"别让任何技术拿走你的人类能动性"
在对话接近尾声时,李飞飞给出了她最想传递给现场每一个人的一句话——不论你是艺术家、小提琴手、钢琴家,还是教师:不要让任何技术拿走你的人类能动性(human agency)。她提醒说,包括硅谷在内,总会有一些声音告诉你,某项产品或某项技术可以替你完成判断——是否安全、是否高效,都可以交给它来决定。她的建议是:紧紧握住自己的能动性。技术,包括今天的AI,应该是用来增强人类的创造力与生产力的工具,而不应成为替人类做决定的主体。被问及如果能对当年那个年轻的自己说一句话,她会说什么,李飞飞的回答带着几分坦诚的自省:以她成长的文化背景而言,她当年经历的自我怀疑,或许原本可以少一些。
现场提问:创业路上的"孤独感"
对话进入观众提问环节。第一位提问者Alex目前正在创业,他坦言创业者常常显得"很有趣",但私下的状态未必如此,他想知道李飞飞是否也经历过类似的低谷,又有什么建议留给现场同样在创业的人。李飞飞的回答很坦诚:创业,是的,就是孤独的,这几乎是这条路无法绕开的一部分。她说,正因为创业者肩上压着太多需要独自扛下的恐惧与待办事项,孤独感几乎是必然会出现的副产品——与其对抗它,不如学会与它共处。
十年级学生的提问:文字之外,如何采集"空间数据"?
一位就读高一(十年级)、曾参与TDK演讲比赛的学生Amy Gao提出了一个相当专业的问题:既然今天的AI大多是从互联网上的文本中学习的,那么要为空间智能模型采集数据,最大的挑战会是什么?李飞飞说,这正是问题的核心:互联网上最丰富的数据形式是文本,但空间建模需要的远不止像素,还包括几何结构、物理规律与动态变化。视频数据虽然是数量最庞大的像素类数据,但物理规律、几何结构这些信息并不会随着视频"显性地"一并被记录下来——研究者必须想办法把这些隐藏的结构从视频中反推出来,或是找到合适的方式将其编码进模型的表征之中,而这正是当前最棘手的挑战所在。
开发者追问:World Labs要补上的,是哪一块拼图?
硅谷本地一位正在搭建AI硬件平台的开发者Bill提到,他的团队目前使用的是英伟达Cosmos等现成的世界模型,但发现这些模型更接近"3D模型",而非真正意义上的全链路解决方案。他向李飞飞抛出了三个问题:这中间缺失的最关键一块拼图是什么?World Labs打算如何填补这个缺口?以及相关产品的发布时间线是怎样的?李飞飞笑说不会在现场官宣产品时间线,但明确回应了前两个问题:World Labs的使命,是通过尽可能精准地建模真实世界,来服务空间与物理智能的实际业务需求。相比单纯的"渲染器",World Labs的定位更接近"仿真层"——因为无论是视觉特效、游戏、机器人,还是建筑设计与工业应用,这些真实场景所需要的精度与保真度,都远远超出了普通视频生成模型所能提供的范畴。
最后一个问题:数据到底该怎么采?
最后一位提问者本身从事影像与测绘相关工作,他认同李飞飞此前的观点——相比芯片和模型,数据确实被严重低估——并追问:对于物理AI而言,众包式的数据采集是不是最好的路径?构建世界模型,最理想的数据收集方式又该是什么?李飞飞的回答颇为审慎:她并不认为众包(比如特斯拉那种模式)在当下适用于机器人领域,除非已经存在一个足够成熟的人类使用场景,能够在人们正常使用产品的过程中"顺带"完成数据采集——就像人们每天开车这件事本身,就是一个天然、成熟的数据采集闭环,背后有成熟的传感器体系支撑。但消费级机器人目前既没有成熟的硬件,也还没有形成成熟的商业使用场景,缺少这个前提,"数据飞轮"就很难真正转起来。她也提到,行业里正在尝试其他路径,比如远程操作(teleoperation)与第一人称(egocentric)数据采集。她坦言,在真正找到那个"飞轮"之前,这在某种程度上更像是一场"资金的游戏"——谁愿意在数据采集上投入更多,谁就更有机会先跑出来。
提问环节结束,主持方向两位嘉宾致谢,称这是一场充满启发、也让人深受触动的对话。至此,李飞飞与Richard Lui的这场炉边对话圆满结束。

文章精选:
1.图灵奖得主姚期智最新演讲: AI有边界,恰恰是好事
