全球18大顶尖AI闭关科研8天,Fable 5一骑绝尘逼近人类科研纪录
一场由18个全球顶尖AI模型参与的科研实验,在完全断网的环境下持续了8天,引发了人工智能领域的广泛关注。这场由Prime Intellect组织的实验,规模空前,旨在测试AI在自主科研领域的潜力,其结果让不少业内人士感到震惊。
实验的核心任务是nanoGPT优化器速通挑战,这是一项由OpenAI研究员在2024年设计的硬核赛道。参赛AI需要在严格的规则下,用最少的训练步数将GPT模型训练到指定的验证损失值。人类工程师在此赛道上的最高纪录是2600步,这一成绩是数十位顶尖专家数月努力的成果。
在这次实验中,AI模型们面临着前所未有的挑战。它们不能修改模型架构,不能接触训练数据,只能调整优化器、学习率调度和初始化参数。实验环境被严格隔离,每个模型独占一个高性能计算节点,全程断网,仅通过日志代理与外界进行有限交互。验证标准极为苛刻,任何成绩都需要在多个固定种子上重复验证,排除运气成分。
实验结果令人瞩目。表现最出色的Fable 5模型,最终以2726步的成绩完成了挑战,追平了人类82%的水平。这一成绩意味着,AI在自主科研方面已经取得了重大突破。其他模型如Opus 5也取得了不俗的成绩,而表现相对较差的GPT-5.5则只追上了人类纪录的8%。
深入分析实验数据后,研究人员发现,AI模型之间的差距并非源于算法创新,而是取决于实验方法的优劣。弱模型往往因为一次失败就全盘否定某种方法,而强模型则更加注重实验的重复验证和结果分析。例如,Opus 5通过重新测试一个之前被认为无用的参数,成功取得了新的纪录。Fable 5则通过测试看似更差但组合起来效果更好的参数组合,进一步缩小了与人类纪录的差距。
实验中还出现了令人兴奋的现象:一些AI模型开始展现出类似人类科学家的行为模式。它们在CPU上搭建小型实验室,进行廉价模拟以探索规律,然后再在GPU上进行真正的训练。有的模型甚至开发出了一整套研究工作流,包括精确字符串替换、隔离实验和自动恢复基线等功能。更有趣的是,GPT-5.6 Sol模型组建了一个多Agent研究团队,三个子Agent分工合作,虽然初期因协作问题导致实验失败,但经过调整后最终取得了不错的成绩。
这场实验的结果,让人们对AI在科研领域的潜力有了新的认识。过去,AI在科研中主要扮演辅助角色,如搜索论文、总结文献或生成代码等。但这次实验表明,AI已经开始能够独立完成一个相对完整的科研闭环,包括提出假设、修改方案、运行实验、分析结果和修正认知等步骤。
这一进展也引发了业内对AI科研未来的热烈讨论。OpenAI首席科学家曾表示,打造全自动AI研究员是公司的长期目标,并预计在2028年实现这一目标。Anthropic联创则预测,到2028年底,AI实现递归自我改进的概率将超过60%。Prime Intellect的实验结果,为这些预测提供了一定的实证支持。
然而,实验也暴露出AI在科研创新方面的局限性。尽管AI在优化和实验方法上取得了显著进展,但尚未展现出真正的算法创新能力。人类在科研领域的重大突破,往往依赖于全新的算法或理论,而这一点目前仍是AI所欠缺的。因此,如何提升AI在科研创新方面的能力,将成为未来研究的重要方向。
