解读前沿人工智能的两用生物学基准测试:度量、饱和效应与代际分析

图丨Pexels
8月6日,兰德(RAND)公司发布研究报告《解读前沿人工智能的两用生物学基准测试:度量、饱和效应与代际分析》(Interpreting Dual-Use Biology Benchmarks for Frontier AI : Measurement, Saturation, and Generational Analysis)。
该报告指出,现有两用生物学基准测试数据仍具备可用的测量信号,但这类信号分布并不均衡。在由8146个测试条目构成的全部样本集中,基准测试样本的难度与信息含量差异巨大。对于前沿人工智能系统而言,大量测试条目如今已难度偏低,性能饱和现象集中出现在低难度区间。不过该样本集尚未被完全穷尽:仍留存一小部分难度高、区分度强的测试条目,当前模型尚无法完成,且能够继续区分不同前沿系统的能力高下。实际应用层面,这意味着尽管基准测试结果的外部效度存在局限,但依旧能够反映技术取得进展的具体方向。
该研究在统一的项目反应理论(IRT)量表上,对测试条目难度、前沿人工智能能力以及人类专家能力进行测算,并采用统一分类体系对测试条目加以标注,得出如下研究结论:
- 基准测试样本的难度与信息含量参差不齐。虽然前沿人工智能已经在数据集的大部分内容上达到性能饱和,但数据集中仍保留一组具备参考价值的高难度样本,超出当前人工智能的性能上限。
- 项目反应理论可用于更清晰地解析模型代际能力提升。Gemini 3.0 Pro相较于2.5 Pro,在高难度条目上实现能力提升,Gemini 3.1 Pro延续该提升趋势。Gemini 3.1 Pro在与专家故障排除和故障识别相关的高信息样本上有所改善。
- 数据集的10%即可用于评估前沿模型性能。依据预估信息值筛选条目时,能力评估结果与完整数据集评估结果的相关度可达99%。
- 该研究构建了一套分类体系,实现样本之间的可解释性区分。推理方向用于阐释输入内容与预期输出之间的逻辑关系,对应生物学研究工作的不同阶段。
该报告建议:
1. 测量并报告难度、区分度、覆盖范围和性能饱和情况。相关指标的公开报告能够提升基准测试结果的可解释性,助力后续评估开发聚焦高信息价值、样本不足的领域。饱和程度应针对正确响应的多个概率阈值进行报告。
2. 公开条目响应数据。尽可能共享条目级响应表,保证不同求解主体的测试条目标识保持一致;必要时需规避基准测试原始内容泄露。针对私有、不可对外公开的基准测试,可采用匿名条目编号实现该要求。公开条目响应数据能够助力研究社区完成以下工作:
– 在统一标准量表上衡量前沿模型性能水平
– 预判未来系统大概率会在现有基准测试的哪些位置出现性能饱和
– 筛选区分效力依旧较强的评估项目
– 支持跨评估的外部复现、重新校准以及元分析研究
3. 开展跨基准测试的条目层级分析。评估人员应当判断性能提升是数据集整体能力的普遍进步,还是集中于某些特定研究维度。分级分类体系可用于筛选不同基准测试内部、跨基准测试之间与研究目标相关的样本子集。
4. 后续基准测试开发应当拓展更多高区分度任务,任务难度需要超出当前前沿模型的能力区间;在条件允许的情况下,还应当超越现有人类专家基准的能力范围。重点扩充样本占比不足的任务类型,如反向推理任务、开放式评估任务。
资料来源丨RAND
本文由生物安全情报网编译,仅用于学术分享,转载请注明出处
阅读原文献请点击“阅读原文”
