Cell封面:AI抗衰老研究工具包“登场”,加速长寿研究与药物研发
继上周抗衰老突破成果登
Nature Biotechnology
后, 9月18日
,
英矽智能
宣布,其与 Liquid AI、巴克衰老研究所、哈佛医学院及布莱根妇女医院研究人员合作完成的最新研究发表于《Cell》杂志,并入选该期封面文章。
在该研究中,联合团队首次向全球科学界推出了一套开放式 AI 工具包,包含用于评估 AI 衰老生物学推理能力的开放基准测试
LongevityBench
,基于临床和多组学衰老数据训练的一系列轻量级开源大语言模型Longevity-LLMs,以及可自主调用专业长寿研究工具的智能体平台 Longevity Claw,旨在加速衰老生物学研究和长寿疗法开发,支持科研人员发现并评估潜在干预靶点。
AI在衰老领域的突破与挑战
衰老是由跨越多个生物层级、交织作用的复杂机制驱动的。要解开这些机制,研究人员需要整合临床病历,以及遗传学、表观遗传学、转录组学和蛋白质组学等海量多组学数据。尽管通用大语言模型已在多项科学任务中展现出卓越性能,但它们在面对真实衰老数据时是否具备可靠的推理能力,仍缺乏系统验证。现有的评估体系大多侧重于测试模型对既有知识的“记忆”,而非考查其解析全新生物测量数据、识别关键模式并导出科学结论的深度推理能力。
为应对这一挑战,研究团队推出了开源基准测试 LongevityBench,专门评估 AI 系统能否基于表征人类衰老的
多模态生物数据
,开展跨领域的逻辑推理。LongevityBench 涵盖临床病历、遗传学、表观遗传学、转录组学和蛋白质组学五大核心模态,旨在全方位考查前沿模型对多维衰老生物学的理解与推演能力。该基准测试的设计尽可能降低了模型仅凭记忆训练数据即可通过测试的可能性。相反,它重点考查 AI 系统分析生物学数据、识别关键特征与模式,以及解决衰老研究相关问题的综合能力。
随后,研究团队利用longevity benchmark评测了来自 OpenAI、Google、
Anthropic
、xAI、DeepSeek 及月之暗面等机构的 18 个前沿 AI 模型。结果显示,各模型在不同生物学领域的能力差异非常明显。

评估前沿模型与微调版 Longevity-LLMs 在 17 项衰老生物学任务中的表现
目前,没有任何一个顶尖模型能够在所有任务中“全科通吃”。仅仅改变问题的表述方式,模型性能就可能出现显著波动。这种稳健性不足,直接影响了通用 AI 在严谨科学研究中的可靠性与可复现性。其中,最具挑战性的任务是根据组学测量数据直接预测生物学年龄。即使是参数规模最大的前沿模型,在这一任务上也面临明显困难。这表明,单纯扩大模型规模,并不能自动带来严谨、稳定的生物学推理能力。
轻量级长寿模型超越通用大语言模型
为了评估能否在不依赖庞大计算资源的前提下克服这些局限,研究团队开发了一系列共 5 款精简型开源长寿大语言模型。这些模型的参数量介于 6亿至90亿 之间,基于
Liquid AI
(如 LFM2 架构)和阿里巴巴(如 Qwen3 及 Qwen3.5 家族)的开源架构打造。团队依托英矽智能专为AI4S设计的训练与评估框架
MMAI Gym for Science
,利用衰老领域的专属临床数据和多组学数据对这些模型进行了深度微调。
进一步评测显示:尽管参数规模相对较小,这些经微调的专有长寿模型在 LongevityBench 上的整体表现仍达到或超过了全部 16 个受测的前沿通用大语言模型。 其中,表现最佳的 L-Qwen3.5-9B 在本研究评估的所有AI模型中取得了最高综合得分,以远低于前沿模型的参数规模,超过了包括 Google Gemini 3.1 Pro 在内的所有受测前沿模型。即使是参数规模最小的专用模型(约 6 亿参数),其表现也优于大多数受测前沿模型。

在大多数任务中,精简型专用模型 L-LLMs 展现出与前沿模型持平或更优的推理性能
研究结果表明,对于特定生物学应用而言,经过精心筛选的科学训练数据和深入的领域优化,其作用可能超过单纯扩大模型规模。此外,轻量级模型对计算资源的需求显著较低,能够以更低成本部署在本地基础设施上,并有望为科研机构带来更高的安全性、可控性与实用性。
发掘高潜力抗衰老靶点
为验证这些模型能否走出基准测试、在实际科研中发挥作用,研究团队将微调后表现最佳的 L-Qwen3.5-9B 集成至最新开源的衰老研究智能体平台 Longevity Claw 中。

Longevity Claw 基于 L-LLM 的靶点发现
作为集成了专用大语言模型与多种科学分析工具的综合智能体,Longevity Claw 突破了传统问答 AI 的局限。它不仅能够回答单一问题,还能自主规划并执行多步骤研究工作流、调用专业工具、评估阶段性结果,并围绕候选生物学靶点自动化汇总与整合证据。 目前,平台已支持包括:基因集富集分析、生物学衰老时钟计算、群体水平表型分析、科学证据检索与综合、候选靶点评估与优先级排序等核心科研任务。
研究人员将该平台应用到了 14 个公认的衰老特征上,使其能够深入探索与衰老相关功能衰退相关的多个相互关联的机制。通过这一自主工作流,Longevity Claw 成功提名了 328 个基因作为抗衰老干预的潜在靶点。与独立发表的具有实验证据支持的衰老相关靶点参考集相比,Longevity Claw 选出的候选靶点展现出了高达 5.6 倍的显著统计学富集度,证实了该平台研究结果的生物学相关性。
在被选出的基因中,KDM1A 在另一项已发表的独立研究中被证实为兼具抗衰老与抗肿瘤功效的“双重用途”靶点。
此前已有独立研究表明,调控 KDM1A 可延长秀丽隐杆线虫的寿命,具备抗衰老与抗肿瘤的双重潜能。 尽管仍需进一步实验验证,但这初步表明 Longevity Claw 有能力发掘出高生物学可信度、且此前可能被长寿药物研发忽视的潜力靶点。
AI 长寿研究全面开源
英矽智能现已陆续在开放 LongevityBench 评测集、专用长寿模型、训练资源、评估代码以及 Longevity Claw 平台,支持全球研究人员开展独立测试、结果验证和后续开发。通过公开这些资源,英矽智能及其合作伙伴旨在为评估 AI 驱动的衰老研究进展建立统一基础。该开源框架也有助于科研人员区分:哪些 AI 系统真正具备生物学推理能力,哪些系统则主要是在复现训练数据中已有的信息。
获取开源资源:
LB Dataset & L-LLMs Collection (Hugging Face):
Longevity Claw Repository (GitHub):
Public Leaderboard:
论文通讯作者、英矽智能创始人兼联合首席执行官Alex Zhavoronkov博士表示
,“长寿研究领域正逐渐超越静态的衰老时钟,迈向能够生成可量化、可行动洞见的基础模型。英矽智能始终处于长寿研究的前沿,正在开发经过基准测试的智能体系统,使其逐步发展为个性化的长寿助手与健康陪伴工具,最终帮助人们更好地监测并改善健康寿命。这类系统有望通过加速治疗靶点识别、推动更具个体针对性的干预,并改善群体层面的健康结局,进一步重塑长寿医学、药物发现、保险和公共卫生等领域。”
参考资料:
[1] Zhavoronkov, A., Naumov, V., Sidorenko, D., Aliper, A., Aladinskiy, V., Hasani, R., Amini, A., Nasto, K., Reymond, M., Shayakhmetov, R., et al. (2026). An open benchmark and language models for AI in aging biology. Cell 189, 1–15.
[2] Zhavoronkov, A., Galkin, F., Chen, S. et al. Integration of proteomic aging clocks in a phase 2a clinical trial supports simultaneous geroprotective assessment. Nat Biotechnol (2026).
