独家观点|灵初智能陈源培:10万小时训练后,“好数据”的标准彻底反转了

独
家
观
点
世界人工智能大会(WAIC)于2024年12月正式推出首份刊物《WAIC UP!》,这是一部「AI时代进化指南」。我们邀请全球AI及跨领域的先锋力量,借由他们的独特视角,针对AI争议问题,带来一些反直觉、非共识的思辨观点。
如今,具身智能行业正在为“高质量数据”投入大量资源,但陈源培的答案是:可能都投错了方向。他把所有精心设计的数据处理模块全部砍掉,只保留最原始的输入输出。结果是,模型的泛化能力反而超过了那些使用“更高质量数据”的版本。
这让他开始重审一个根本问题:当数据从1000小时扩张到10万小时,整个系统运行的底层规律,到底发生了什么变化?
陈源培
灵初智能(PsiBot)联合创始人兼强化学习负责人
2025年福布斯亚洲“30 Under 30–AI”入选者
斯坦福大学访问学者、北京大学人工智能研究院前研究助理
2001年出生,陈源培在校期间自学机器人算法,并参与RoboMaster机甲大师超级对抗赛。此后,他曾任北京大学人工智能研究院研究助理,并于2023年赴斯坦福大学访问,作为核心作者提出Sequential Dexterity(序列灵巧性)。他在人工智能与机器人领域顶级期刊及会议发表论文20余篇,研究涵盖灵巧操作、强化学习与具身智能。作为灵初智能联合创始人兼强化学习负责人,他持续推动PSI系列具身大模型迭代,并参与构建以真实人类数据为基础的具身智能训练体系。
以下为陈源培独家观点的部分摘录:
在大数据规模下,高质量数据效果反而不如原始数据

“当数据量突破某个阈值后,复杂处理后的数据训练出来的模型,泛化能力反而不如使用原始数据的模型。”
/ 01
在具身智能训练中,“高质量数据”一度等同于被充分加工的数据:动作要经过姿态重定向,手指和手腕要增加关键点损失,视频还要清除背景与遮挡。灵初智能也曾沿着这条路径投入大量工程力量,甚至训练质量评估模型,只保留得分最高的前20%用于训练。
“在小数据规模下,这些努力确实带来了立竿见影的效果。在几个标准的操作基准测试上,我们的模型性能比使用原始数据的基线模型高出了不少。”
转折出现在数据规模持续扩大之后。从1000小时到1万小时,再到10万小时,复杂处理带来的增益越来越小,模型的泛化能力甚至开始落后于原始数据方案。“好数据”由此不再是一个固定标准:小数据阶段有效的方法,到了大数据阶段可能不再成立;规模跨过临界点,训练规则也会随之改变。
人类干预越多,效果不一定越好,要把更多学习空间交还给模型
“‘当数据量和计算量达到足够规模后,所有人工设计的模块都会成为性能瓶颈。”
/ 02
在计算机视觉的发展史上,从手工设计特征到卷积神经网络,再到端到端Transformer,每一次范式变化,都在用更简单、更通用的学习方式取代复杂的人工设计。数据足够多时,模型能够学到比工程师预设更有效的特征。
“于是我们做了一个大胆的决定:砍掉所有复杂的额外模块,只保留最基本的输入输出维度对齐。我们直接把原始的RGB视频和对应的机器人动作序列输入到模型中,让模型自己去学习两者之间的映射关系。”
极简方案在小数据规模下并不占优,但当数据量突破阈值,它在泛化能力、长时序执行能力和操作性能上限上展现出优势。这里的“简单”不是少做工程,而是重新分配工程资源:不再追逐每个局部模块的微小提升,而是扩大有效数据的规模与覆盖范围,把更多学习空间交还给模型。

数据质量的优先级:任务>物体>场景
“在数据集分布层面,操作任务多样性(不同操作类型与目标组合)大于物体多样性(不同类别物体覆盖),而物体多样性又远大于场景多样性(不同背景与环境变化)。”
/ 03
这个排序最反直觉的地方,是场景多样性被放在了最后。传统理解中,机器人要进入真实世界,就应该尽可能多地见过不同房间、光线和背景。但现代具身智能系统通常建立在大规模视频生成基座之上,模型已从海量互联网视频中学习了视觉常识、空间变化和部分物理规律,对背景、视角和光照变化具备一定适应能力。
这也是为什么“场景多样性”对于模型能力的提升,并没有我们最初想象中那么重要。相比之下,操作行为本质上是以物体为中心的,所有的操作任务都可以建模为“操作对象+操作方式”的组合。一个模型如果从来没有见过某个物体,其操作能力通常会显著受限。
“采集100个不同品牌的马克杯的数据,不如采集10个不同类别物体的数据有价值。因为模型一旦学会了如何操作一个马克杯,它就能很容易地泛化到其他所有的马克杯上,但如果它从来没有见过剪刀,它就不可能知道如何使用剪刀。”
学术激励正在把行业推向“为了复杂而复杂”
“我们一直在用小数据时代的思维方式,去解决大数据时代的问题。”
/ 04
整个行业之所以会不约而同地走上这条弯路,陈源培认为有三个主要原因。
第一,是计算机视觉的历史惯性。在计算机视觉发展的早期,数据量非常有限,人工设计的特征和处理模块确实能够带来巨大的性能提升。这种思维方式延续到了具身智能领域,让人们想当然地认为,数据处理越复杂,模型性能就越好。
第二,是小数据时代的思维延续。在具身智能发展的初期,人类数据非常稀缺。在小数据规模下,复杂的数据处理确实能够显著提升模型性能,但很少有人意识到,当数据量突破某个阈值后,整个系统的运行规律会发生根本性的变化。
第三,是学术研究的激励机制问题。学术研究天然鼓励创新和复杂的方法设计,一篇提出复杂数据处理算法的论文,远比一篇说明“原始数据最好”的论文更容易发表。这种激励机制导致整个行业都在追求更复杂、更“聪明”的方法,而忽略了更简单也更有效的解决方案。
数据采集的“军备竞赛”可能是在为错误的事情花钱
“整个行业都在疯狂地建设数据采集中心,比拼谁的采集设备更先进,谁的采集场景更丰富,谁的数据量更大,但很少有人停下来思考,这些投入真的值得吗?我们采集的数据,真的是模型最需要的吗?”
/ 05
行业正在投入大量资金建设采集设施:从几百元的头戴式相机,到数百万元的高精度光学追踪系统;从自由环境采集,到标准化数据工厂,设备精度、场景数量和数据时长都可以被迅速量化。但这些容易被展示的投入,并不能直接证明数据更有价值。
昂贵不等于有效,数据的真正价值在于它包含多少“新的操作信息”,而不是采集它的设备花了多少钱。如果采集的数据集中在重复的场景和同类物体上,即使设备再精密、场景再丰富,对模型泛化能力的提升也微乎其微。
换句话说,大数据时代的竞争,不只是“谁拥有更多数据”,更是“谁更早看懂哪些数据值得被规模化”。
可在微信小店购买纸刊
也可扫码在线阅读

扫码进入#07期《WAIC UP!》
解锁10篇AI时代最实用的解决方案
Hello:
世界人工智能大会(WAIC)推出首份刊物《WAIC UP!》,一部「AI时代进化指南」。
WAIC UP! WAKE UP MORE!
我们邀请全球AI及跨领域的先锋力量,共同释放思考的力量与智慧的主张,旨在唤醒更多人,探究关乎技术跃迁、自我边界和未来文明的无限可能。
准备好!释放你的思考,觉醒你的行动,与我们一同探究那些尚未显现的可能性,勾勒以人为中心的未来智慧文明全景图!










