AI读懂血液中的癌症信号!北大医院王鹏远、陈善稳团队联合多中心在 Nature Communications 发表研究成果
近日,国际知名学术期刊
《Nature Communications》
在线发表了由北京大学第一医院胃肠外科王鹏远教授、陈善稳副研究员/主治医师团队联合多中心完成的重要研究成果,题目为
Decoding Cancer Circulating Transcriptomic Signatures with Language Models
。
该研究提出了一种面向血浆游离RNA(cell-free RNA,cfRNA)分析的语言模型框架 GeneLLM,尝试像“阅读语言”一样直接解码血液中循环转录组序列,从而识别癌症相关信号,为多癌种早期筛查和液体活检技术发展提供了新的人工智能解决方案。

癌症早期发现是改善患者预后的关键。传统影像学、内镜检查和组织活检在临床诊疗中发挥着重要作用,但也存在侵入性、依从性、成本和可及性等方面的限制。近年来,液体活检因其无创、便捷、可重复检测等优势,成为肿瘤早筛和动态监测的重要研究方向。
与循环肿瘤DNA相比,cfRNA能够更直接反映机体和肿瘤组织的动态转录状态,有望为肿瘤早期检测提供更加丰富的信息来源。
然而,现有cfRNA检测方法大多依赖已知基因注释和基因表达量分析,这就像只阅读一本书中“已经标好目录的章节”,而忽略了大量尚未被充分注释的序列信息。实际上,人体基因组和转录组中仍存在大量未被传统注释体系充分解释的区域,包括重复序列、未注释区域和其他“转录组暗物质”。这些区域中可能蕴藏着与肿瘤发生发展密切相关的重要信号,却常常被传统分析流程过滤或忽略。
本研究提出的 GeneLLM 正是为了解决这一问题。它绕开传统基因表达矩阵和基因注释依赖,直接处理血浆cfRNA测序reads的核苷酸序列,利用Transformer语言模型从海量短序列中学习癌症相关模式,并进一步挖掘出具有判别能力的“伪生物标志物”(pseudo-biomarkers),用于多癌种识别和分类。
01 核心发现:用语言模型直接“阅读”血液中的cfRNA序列
该研究纳入来自北京大学第一医院、北京医院、浙江大学医学院附属邵逸夫医院等多中心的 496例血浆样本,其中包括 332例癌症样本,覆盖结直肠癌、胃癌、肝癌、肺癌四类常见实体瘤及非癌对照人群。研究团队对血浆样本进行cfRNA提取、建库和测序,并将清洗后的cfRNA reads输入预训练的 GeneLLM 模型,用于预测不同癌种发生的可能性。
GeneLLM 的核心创新在于:它并不首先把cfRNA reads归并到已知基因上,也不依赖传统差异表达基因分析,而是将cfRNA短序列切分为类似“词语”的7-mer核苷酸片段,通过语言模型学习这些“词语”在癌症状态下的组合规律。换句话说,GeneLLM 尝试建立一种“cfRNA语言模型”,让人工智能直接从血液中的核酸序列中捕捉疾病相关语义。

研究结果显示,GeneLLM 在结直肠癌、胃癌、肝癌、肺癌及泛癌检测中均表现出较高的判别能力。论文结果显示,GeneLLM 在多癌种任务中的ROC-AUC达到约 0.9250–0.9962,四类癌种及泛癌检测的AUC均超过0.9,显示出较好的癌症识别性能。
02 研究亮点:从“转录组暗物质”中寻找癌症信号
传统cfRNA分析通常依赖基因注释信息,因此容易忽略来自未注释区域、重复序列或其他非典型转录区域的信号。而本研究发现,GeneLLM 所学习到的伪生物标志物并不局限于已知基因区域,而是能够从“转录组暗物质”中提取与癌症分类相关的潜在信息。

这一发现提示,血液中的cfRNA并非只包含已知基因表达信号,还可能携带大量传统方法难以利用的疾病相关信息。GeneLLM 通过直接建模原始cfRNA序列,突破了基因注释依赖,为液体活检提供了一条新的分析路径。
研究团队进一步发现,不同癌种对应的伪生物标志物具有一定癌种特异性。例如,胃癌相关伪生物标志物在胃癌样本中表现出更高得分,而在其他癌种或非癌样本中较低。这说明 GeneLLM 不仅可以识别“是否存在癌症”的总体信号,也可能进一步捕捉不同癌种的特异性循环转录组特征。
03 浅测序仍保持性能:为降低癌症筛查成本提供可能
癌症早筛技术要真正走向临床和人群应用,除了准确性以外,检测成本和可推广性同样至关重要。标准cfRNA测序通常需要较高数据量,而高深度测序会增加检测成本和计算负担,限制其在大规模筛查中的应用。
本研究进一步评估了 GeneLLM 在浅测序条件下的表果显示,即使在约为常规测序深度六分之一的条件下,GeneLLM 仍能保持与高深度测序相近的检测性能。这一结果提示,该模型能够有效利用cfRNA数据中最具信息量的片段,在降低测序成本和提升筛查可及性方面具有潜在优势。
对于未来癌症早筛而言,这一点具有重要意义:如果模型能够在较低测序深度下保持较好识别能力,就有望降低检测门槛,使基于血浆cfRNA的多癌种筛查更加经济、便捷和可推广。
04 多中心验证:推动AI液体活检走向临床转化
本研究采用多中心样本进行建模和验证,并在分析过程中针对不同来源医院可能带来的批次效应和来源偏倚进行了控制。研究团队在疾病调优阶段引入 在多个任务中优于基于表达矩阵的传统机器学习模型,并在公开数据集验证中表现出较好的泛化能力。这说明,直接基于cfRNA原始序列进行建模,可能比单纯依赖已知基因表达矩阵更充分地利用血液转录组信息。
当然,研究团队也指出,GeneLLM 仍需在更大规模、更广泛人群和前瞻性临床队列中进一步验证。未来,随着更多cfRNA数据积累、模型优化和多模态信息整合,该技术有望在癌症早筛、辅助诊断、疗效监测和复发预警等方面发挥更大价值。
05 研究意义:让人工智能打开癌症早筛的新窗口
本研究将人工智能语言模型与血浆cfRNA液体活检相结合,提出了一种不依赖传统基因注释的癌症检测新框架。其意义主要体现在三个方面:
第一,技术路径创新。GeneLLM 直接读取cfRNA核苷酸序列,突破传统基因注释和表达矩阵分析的限制,为循环转录组数据分析提供了新思路。
第二,生物学信息拓展。研究从“转录组暗物质”中发现癌症相关信号,提示未注释区域可能蕴含重要诊断价值,也为未来肿瘤生物学和标志物研究提供了新的切入点。
第三,临床转化潜力。GeneLLM 在多癌种检测和浅测序条件下均显示出较好性能,为降低检测成本、提升早筛可及性和推动大规模液体活检应用提供了潜在技术基础。
该研究不仅展示了人工智能在癌症早筛领域的应用潜力,也体现了临床医学、人工智能、转化医学和多中心协作交叉融合的重要价值。未来,随着算法不断优化和临床验证持续推进,AI驱动的液体活检技术有望为肿瘤早期发现和精准诊疗带来新的突破。
06 研究团队
该研究由北京大学第一医院胃肠外科、北京航空航天为末位通讯作者,陈善稳副研究员、主治医师为共同通讯作者,共同设计了临床验证方案,并协调推动多中心人群样本研究。该成果充分体现了北大医院在胃肠道肿瘤临床研究、液体活检、人工智能辅助诊断和转化医学领域的持续探索和创新能力。
王鹏远
北京大学第一医院副院长,胃肠外科主任医师、教授,博士生导师。长期致力于胃肠道肿瘤的临床诊疗、基础研究与转化医学研究,围绕消化系统肿瘤早期诊断、精准治疗和多学科协作开展系列工作,推动临床问题导向的创新研究和成果转化。
陈善稳
北京大学第一医院胃肠外科副研究员、主治医师、硕士生导师,北京市科技新星,北京大学第一医院学术带头后备骨干。主要从事胃肠道肿瘤外科治疗、肿瘤转化医学和新型诊疗技术研究,长期关注消化系统肿瘤早筛、液体活检、肿瘤免疫治疗和人工智能辅助诊断等方向。
文章引用:Deng S, Sha L, Jin Y, et al. Decoding Cancer Circulating Transcriptomic Signatures with Language Models. Nature Communications. 2026. DOI: 10.1038/s41467-026-74411-3.
