AI下一站是空间智能!AI教母李飞飞:开发者不只要写应用,还要给AI创造一个能行动的世界
单击上方“图灵人工智能”,选择“星标”公众号
您想知道的人工智能干货,第一时间送达


“There is more beyond language intelligence.”
李飞飞:语言智能之外,还有更大的世界。
大模型能写代码、做数学题,也能从一张照片里认出桌子和杯子。可如果把它放进一间陌生的房间,它未必知道杯子离桌边还有多远,伸手去拿会不会碰倒旁边的水壶。
李飞飞把这条差距称为AI的下一章:空间智能。
备注:李飞飞被业界称为“AI教母”,是ImageNet项目的主要推动者之一。她现任斯坦福大学计算机科学教授、斯坦福以人为本人工智能研究院联合主任,同时也是空间智能公司World Labs联合创始人兼CEO。
在新一期访谈中,李飞飞用了两个多小时讨论人类视觉、AI学习和创造力。
讲到World Labs时,她把话题拉回正在发生的技术变化:大语言模型让机器掌握了文字和概念,下一步要让它理解空间、时间和物体之间的关系。
开发者很快就会遇到这类模型。游戏场景、机器人训练、建筑设计和虚拟制作已经开始接入世界模型。
过去API返回文字或图片,现在World Labs想返回一个可以进入、编辑和继续运行的环境。
以下为访谈内容,我们进行了翻译与整理。
Agent读完代码库,也不代表它理解了世界
主持人提到了一个场景。
一个孩子见过猫以后,即使只看到书架后面露出一截尾巴,也可能认出那是一只猫。他没有看过几百万张猫的图片,更没有浏览过整个互联网。
李飞飞:孩子也许只见过3只猫,最多10只。可今天的模型之所以能稳定识别相似场景,靠的是规模庞大的训练数据。人类如何用少量经验形成对物体和环境的理解,至今没有被完全解释。

李飞飞认为,孩子只看过很少的样本,也能识别新的场景;这种学习机制仍未被当前AI复现
软件团队也有同样的问题。
故障原因写在日志里,Agent可以继续追;业务规则只存在于老员工脑子里,它只能猜。仓库缺少文档、服务边界没人记录、事故复盘散落在聊天记录里,模型读完整个代码库也补不齐这些信息。
给Agent准备上下文,不能只靠扩大窗口。
下一代API返回的,可能不是答案,而是一个“世界”
图像模型可以给画面里的物体打标签,但空间理解要回答更多问题:杯子在哪里,桌面有多高,前面的物体遮住了什么,人转过身以后房间是否还是同一个房间。
机器人面对的要求更高。
它伸手拿杯子之前,要估计距离和方向;动作执行以后,还得预测杯子、水壶和桌面会发生什么变化。
语言能描述这些关系,却无法完整替代三维结构和物理过程。李飞飞因此认为,语言智能不是AI能力的终点。
“Unlocking spatial and physical intelligence is really the next chapter.”
李飞飞:解锁空间与物理智能,才是AI的下一章。

李飞飞介绍World Labs的技术方向,空间与物理智能将补上语言模型尚未覆盖的能力
这也是“世界模型”与聊天机器人的区别。聊天机器人根据输入生成回答;世界模型还要维护一个环境,理解其中的物体和规律,并估计一次动作会把环境变成什么样。
World Labs将这套能力拆成渲染、模拟和规划。渲染负责呈现世界,模拟负责计算变化,规划负责决定下一步怎样行动。真正困难的地方,是让三者在同一个循环里保持一致。
世界模型生成的不是一张图,而是一个能继续探索的环境
李飞飞在访谈中介绍了World Labs的做法。
用户输入一句话、一张图片或一幅草图,模型尝试把它变成三维世界。这个世界可以移动视角、继续扩展,也能交给创作工具和机器人训练流程使用。

李飞飞介绍World Labs的目标,将文字、图片和草图转换成可探索的三维环境
漂亮的3D画面只能证明模型会生成画面,不能证明它理解了这个空间。
开发者还要检查尺度是否稳定、换个视角后物体会不会变形、碰撞关系是否正确,以及离开后再回来,环境是否仍然保持原样。
World Labs在官方技术文章中也承认,世界模型内部存在不同目标。
世界模型距离稳定的生产工具还有一段路。中间缺的那些评测、编辑、存储和运行能力,正好都是软件工程要补的部分。
新机会不只属于3D工程师
训练世界模型主要是图形学和机器人团队的工作,把它做成产品却离不开普通应用开发。
一个线上家装工具需要账户、项目管理和多人协作;一个机器人训练平台需要数据版本、任务队列和评测系统;一个可探索的AI场景,也需要在网页和移动端稳定加载。模型负责生成世界,产品仍需要前端、后端、数据和平台工程。
开发者可以关注几项更具体的能力:
·WebGPU、Three.js和实时3D渲染;
·3D Gaussian Splatting等新型场景表示;
·世界模型API的异步任务、存储和前端集成;
·仿真环境与真实设备之间的数据闭环;
·空间一致性、物理正确性和动作成功率评测。
大多数开发者不需要从头训练世界模型。把生成的环境接进产品,并让它可编辑、可评测、可运行,已经足够形成一条很长的开发链路。
AI可以帮你做事,别把学习和判断一起交出去
这场访谈里,李飞飞反复使用一个词:agency。
它可以理解成人决定目标、主动学习并采取行动的能力。李飞飞并不主张远离AI。她担心的是,工具变得方便以后,人开始被动接受答案,连提出问题和判断结果的过程也一并省掉。
“It is about enhancing and augmenting humanity.”
李飞飞:AI应该增强人的能力。

李飞飞认为,AI应该增强人的能力,而不是夺走人的选择权
她谈到年轻人使用AI时,给出了两种都不理想的结果。
一种是因为担心作弊,学校拒绝让学生使用AI;另一种是学生把思考全部交给工具,逐渐失去学习动力。

李飞飞认为,AI教育最坏的结果,是工具拿走年轻人的学习主动性和动力
她甚至建议学校教授Prompt,因为向模型准确描述背景、限制和目标,本身就是一种需要练习的能力。

李飞飞把Prompt视为一项需要教育和训练的能力
开发工作也是如此。Agent可以读仓库、生成场景或运行测试,开发者仍要决定为什么做、结果能不能用、失败后怎样收场。AI进入的环境越复杂,这些判断越不能交给一次模型调用。
写在最后
过去两年,开发者熟悉的AI入口一直是聊天框和代码编辑器。
空间智能把下一批入口指向了浏览器里的3D环境、机器人模拟器、设计工具和现实设备。
语言模型不会因为世界模型出现就消失。比较现实的组合是:语言模型理解意图,世界模型建立环境并模拟变化,Agent负责调用工具和执行动作。
开发者可以先做一件很具体的事:把世界模型当成一种新的可编程媒介,而不是一张更炫的图片。去调用API,检查生成结果能否保持一致,把它接进现有产品,再看看渲染、交互、评测和数据链路里还缺什么。
当生成结果要被真正使用时,缺口会立刻出现。下一批开发工具和产品,可能就从这些缺口里长出来。
参考链接:

文章精选:
1.图灵奖得主姚期智最新演讲: AI有边界,恰恰是好事
