Cell子刊:浙江大学金凯团队构建眼科多模态AI智能体AgentEYE,实现可追溯、证据驱动的眼科诊断支持
人工智能正在快速进入眼科诊疗场景。过去十余年,基于眼底照相、OCT等单一影像的深度学习模型已经在糖尿病视网膜病变、青光眼、视网膜结构分析等任务中取得重要进展。然而,真实临床诊断并不是单张图片的分类题。眼科医生往往需要同时整合眼底照片、B超、病史线索、指南证据和鉴别诊断,在不确定性中形成较为完整的诊断判断和管理建议。
现有眼科AI系统大多仍停留在单任务、单模态或弱证据支撑阶段,难以模拟临床医生对多源信息的综合推理,也难以让医生审计其诊断依据。如何构建一个既能看懂多模态眼科影像,又能调用专业工具、检索医学证据、生成可追溯诊断报告的临床AI系统,是眼科人工智能走向真实应用的重要问题。

近日,浙江大学医学院附属第二医院眼科中心金凯团队联合新加坡南洋理工大学、美国宾夕法尼亚大学、波兰奥尔什丁瓦尔米亚玛祖里大学等机构,开发并系统评估了一种自主多模态眼科AI智能体AgentEYE。相关成果发表于
Cell Reports Medicine(IF 14)
。该研究题为
An Autonomous Multimodal AI Agent for Evidence-Grounded Ophthalmic Diagnosis
。
AgentEYE不是简单的“大模型看图问答”。它被设计为一个模块化、可审计的眼科诊断智能体:系统首先对同日采集的眼底图像和眼科B超图像进行模态路由,再分别调用专门训练的眼底和B超影像工具,随后根据诊断需要检索指南和网络医学证据,最后由大语言模型推理核心整合影像工具输出、检索证据和临床逻辑,生成带有参考依据的眼科诊断报告。
在302例同日多模态内部测试集中,AgentEYE在诊断正确性和报告完整性方面均明显优于直接使用大语言模型的基线方法。
满分100分的自动化报告评估中,完整AgentEYE的诊断正确性得分为71.93,报告完整性得分为75.59;相比之下,LLM-only基线分别为36.52和48.57。消融实验显示,专门化眼科影像工具是性能提升的关键因素。去除这些工具后,诊断正确性降至39.40,完整性降至53.23。

值得注意的是,检索模块对自动化诊断分数的增益有限,但对证据支撑和引用可审计性具有重要价值。去除检索后,诊断正确性和完整性分数与完整AgentEYE接近,提示在该任务中,检索的核心作用不是单纯“提分”,而是让报告中的医学依据更可追溯、更便于医生核查。
为了进一步验证临床相关性,研究团队在200例分层内部病例上进行了眼科医生盲评。3名眼科医生独立比较AgentEYE与带自生成引用的LLM-only基线报告。结果显示,AgentEYE的多数投票诊断正确率为83.0%,明显高于基线的42.0%;报告完整性为82.5%,高于基线的41.5%。在安全性方面,AgentEYE的有害输出比例为3.5%,而基线为29.0%。

在引用和证据溯源方面,AgentEYE同样表现突出。眼科医生多数投票认为,AgentEYE报告中86.5%的引用是正确的,而自生成引用基线仅为46.5%。经医生二次判定,AgentEYE存在引用溯源问题的报告为24/200,低于基线的103/200;不可核实或疑似幻觉来源仅出现在基线中,为14/200,而AgentEYE中未观察到此类问题。
研究还评估了AgentEYE的可追踪工作流。在302例内部测试集中,AgentEYE对适用病例均完成了预期的眼底和B超路由及工具调用,没有遗漏或不必要的眼底/B超工具调用。系统在86.4%的病例中触发检索,平均每例进行1.89次检索查询。这种工作流使诊断报告不再是单一黑箱输出,而是可以回看图像路由、工具解释、检索证据和最终综合判断的链条。
外部验证提示,AgentEYE的泛化能力与疾病谱和数据分布有关。在50例中国外部基准类别病例中,AgentEYE相比LLM-only将诊断正确性提高18.53分,将完整性提高11.17分。在25例波兰外部队列中,两者表现相近。
对于35例内部工具标签空间之外的未见疾病,AgentEYE未显著提高诊断正确性,但提高了报告完整性。这说明AgentEYE在跨中心、基准疾病类别中具有应用潜力,同时也提示其仍需在更多疾病、设备和临床场景中进行前瞻性多中心验证。
总体而言,该研究展示了一种面向临床工作流的眼科智能体范式。AgentEYE通过“专业影像工具 + 医学证据检索 + 大模型综合推理”的方式,将眼科AI从单一影像分类推进到可追溯的多模态诊断支持。
研究者也强调,AgentEYE应被理解为临床决策支持系统,而不是替代医生的诊断权威。其价值在于帮助组织复杂的多模态信息、呈现可能的鉴别诊断、提高报告完整性,并为医生提供可核查的证据依据。
随着医疗AI监管越来越强调透明性、可解释性和可审计性,这类模块化智能体系统有望成为医学大模型进入高风险临床场景的重要路径。未来,AgentEYE仍需接受前瞻性、多中心、真实世界研究检验,包括不同设备、不同疾病谱、不同医疗机构和医生辅助使用场景下的安全性、有效性和工作流影响。
原文链接:https://www.cell.com/cell-reports-medicine/fulltext/S2666-3791(26)00386-1
