Science子刊:中国学者开发新的大模型,自动化搞定遗传变异分类,给罕见病诊断提效
近年来,大型语言模型(LLMs)在医学应用中的潜力已得到广泛测试;然而,其在临床遗传学(尤其是罕见病诊断)方面的作用仍未得到充分探索。LLMs的最新进展提升了其推理能力和透明度,从而促进了临床工作流程设计的优化。
2026年6月24日,香港基因组研究所鍾侃言独立通讯在
Science Translational Medicine
在线发表题为
AI-CURA, an automated LLM workflow for high-accuracy genetic variant classification
的研究论文。
该研究开发了AI-CURA框架,该框架能够根据美国医学遗传学与基因组学学会(ACMG)和分子病理学协会(AMP)指南以及临床基因组资源(ClinGen)建议,近乎完全自动地对遗传变异进行分类。
该框架整合了对非文献依据标准的证据评估(可使用标准生物信息学工具实现自动化)以及基于LLM的文献依据独立评估。作者测试了两种最先进的LLMs,即DeepSeek-R1和o3-mini-high,评估它们在总结与变异分类相关的文献来源证据方面的性能。
研究表明,通过精心设计提示(prompt)并构建ACMG规则特异性知识库,DeepSeek-R1在解读需要理解文献依据的ACMG规则方面优于o3-mini-high,并实现了高灵敏度和100%的特异性。在针对ClinGen专家整理的150个变异的进一步测试中,DeepSeek-R1在最终诊断上与人类专家表现出高度一致性。最后,作者证明AI-CURA还可用于对150个来自ClinVar且存在解释冲突的变异进行重新分类分析。
本研究提供了一个LLM框架,能够实现遗传病诊断中的自动化变异分类与变异重新分析。

大型语言模型(LLMs)在医学应用中已展现出巨大潜力。当前最先进的LLMs显著增强了推理能力,预计在处理复杂的生物医学信息方面将具备更强大的功能。在罕见病的诊断中,全基因组测序(WGS)已被证明对结束许多患者的诊断困境至关重要。
为了管理通过WGS识别出的海量变异,美国医学遗传学与基因组学学会(ACMG)、分子病理学协会(AMP)以及临床基因组资源(ClinGen)工作组等机构已努力制定相关指南与建议(https://clinicalgenome.org/working-groups/sequence-variant-interpretation/),这些指南现已构成最广泛采用的循证变异分类系统。
该分类系统将变异相关证据系统地归类到不同的基于规则的类别中。部分规则,包括基于群体、计算和预测数据的规则,可以利用基因组聚合数据库(gnomAD)和ClinVar等资源,以及REVEL和SpliceAI等生物信息学工具轻松实现自动化。
然而,大多数证据,例如功能性、分离、新生、等位基因和表型特异性数据,仍然需要从文献中进行人工解读。这就要求变异解读人员具备分子生物学和遗传学多个方面的广泛知识,并对ACMG/AMP指南及ClinGen建议有深入理解,以便准确解读和评分变异。
尽管出现了像Exomiser这样的变异优先排序工具,但在单个WGS或全外显子组测序病例中,解读人员通常仍需要查阅数百篇出版物来对排序出的数十个变异进行分类。因此,当前的变异分类系统需要广泛的专业知识和耗费大量人力进行证据审查,这构成了遗传诊断中的一个瓶颈。
香港基因组计划(HKGP)以及众多全球遗传学实验室,正通过开发促进人类与人工智能(AI)协作的自动化分类工作流程来应对这一挑战。

图1.使用LLM将图像谱系转换为文本(摘自
Science Translational Medicine
)
既往研究已开发出用于变异致病性预测和遗传诊断的AI驱动工具,并展现出不同水平的性能。尽管这些工具通常能为变异和证据优先排序提供致病性评分,但它们往往缺乏支持其输出的详细推理过程,限制了其在临床应用中的可解释性。
最近的进展促使将更复杂的AI系统整合到基因组分析工具中,从而提高了对人类专家而言结果的可解释性。然而,这些工具仍未依据既定指南(如ACMG/AMP指南和ClinGen建议)处理证据,最终仍需用户负责人工解读。
在此背景下,LLMs在分析大量文本数据、总结相关证据以及向遗传学家和解读人员建议带有可解释理由的合适ACMG规则方面,显得弥足珍贵。近期研究表明,通过应用提示调优和检索增强生成(RAG)等方法,LLMs能在某些医学任务中超越人类专家。
然而,将LLMs整合到临床遗传学中并非没有挑战。诸如人工智能幻觉和过度思考等问题可能会影响变异分类的准确性,因为这些错误可能导致提供不正确的证据和过度诊断。尽管链式思维提示等策略在减少医学应用中的假阳性方面效果显著,但某些模型特有的幻觉仍然存在且难以消除。
近期发展见证了诸如DeepSeek-R1等LLMs在其推理过程透明度方面的提升,这对于优化其在医学场景中的应用至关重要。DeepSeek-R1的开源性也使其在应用于像HKGP这样出于安全目的要求数据本地保留的基因组项目时具备优势。
鉴于DeepSeek-R1的推理能力可与OpenAI的o3-mini-high等专有模型相媲美,它成为遗传诊断应用中一个有吸引力的候选方案。然而,对于医学LLMs而言,使用ACMG分类系统仍是一个尚未充分探索的领域。先前的研究已开始探索LLMs在ACMG分类中的潜力,但这些研究通常仅涉及有限的ACMG规则,并且在最终决策时仍严重依赖人工解读。
这凸显了进行更全面研究以利用LLMs自动化和提升遗传变异分类过程准确性的机遇。在本研究中,作者专注于优化和评估DeepSeek-R1与o3-mini-high在总结文献证据以及应用这些信息进行变异分类方面的性能。
作者开发了人工智能辅助解读系统(AI-CURA),这是一个能够完全自动化ACMG变异分类的综合性框架,并利用来自ClinGen的150个经专家解读的变异以及来自ClinVar的150个存在分类冲突的变异评估了其有效性。
参考消息:https://www.science.org/doi/10.1126/scitranslmed.adz4172
