生成式AI医疗器械审评:FDA 发布文件

2026年8月,美国 FDA 发布一份 31 页讨论文件,主题是生成式 AI 医疗器械的监管评价。目标是征求外部反馈,讨论现有医疗器械审评体系如何应对生成式 AI 带来的新问题。
医疗 AI 可以接受开放式问题、生成不固定答案,甚至调用外部工具完成多步骤任务。过去依靠固定测试集、固定指标、固定版本的审评方法,已经面临新的评价压力。
FDA 提出的方向包括风险重新划分、能力型上市前评价、临床确认、上市后持续监测,以及第三方基础模型和智能体 AI 的责任边界。对正在把大模型接入影像、诊断、患者管理、临床决策支持软件的企业,这份文件需要提前纳入注册和研发规划。

# 传统 AI 审评的适用边界
过去获批的医疗 AI,大多集中在影像识别、病灶检测、图像分割、风险预测等相对确定的任务。这类产品通常有明确输入和明确输出,企业可以用固定数据集验证算法表现,再用灵敏度、特异度、AUC 等指标说明性能。
例如,一套 CT 影像 AI 判断是否存在主动脉夹层,评价逻辑相对清楚:把算法结果与专家判读或临床金标准比较,再计算性能指标。
生成式 AI 改变了评价前提。FDA 在文件中提到,生成式 AI 医疗器械可能具有开放式输入、多任务处理、同一问题生成不同答案、上线后因基础模型或系统配置改变而持续变化等特点。部分产品还建立在第三方通用基础模型之上,器械企业未必完全掌握模型训练数据、架构细节和底层更新节奏。
固定测试集上的“正确率”只能覆盖一部分问题。监管机构还需要知道,产品在真实临床任务中能稳定完成哪些能力、边界在哪里、出错后的风险有多大。

# FDA开始讨论“能力型审评”
FDA 这次讨论的一个重要概念是 competency-based approach,即以能力为核心的评价方法。
这一思路借鉴了医生培养和评价逻辑。医生取得独立执业资格前,不可能把未来所有病例都测试一遍,评价通常来自知识、推理、临床实践和执业后的持续考核。FDA 正在讨论,生成式 AI 医疗器械是否也可以采用类似框架。
按照目前讨论方向,上市前评价可能包括两部分:非临床能力测试和临床确认。监管重点也会从单个基础模型转向最终交付给医生或患者使用的完整产品配置,包括系统提示词、知识库、检索机制、安全护栏、工作流编排和人机交互设计。
传统医疗 AI 与生成式 AI 审评关注点对比

同一个通用大模型,接入不同知识库、提示词、护栏和临床工作流后,可能形成风险完全不同的医疗器械。FDA 关注的是具体产品在其声明用途下是否安全有效。
# 评价对象可能变成“AI能力”
生成式 AI 还有一个实际难题:很多任务没有唯一标准答案。
影像 AI 判断“有没有病灶”,可以和金标准比较。但如果产品用于病历总结、临床问答、诊疗建议生成,不同医生给出的答案可能本来就不完全一致。
FDA 因此讨论了一种可能路径:部分生成式 AI 医疗器械可以与合格临床医生组成的专家组,或现实中的中位水平医生进行比较。比较对象取决于产品用途。
如果产品用于帮助普通医生处理专科问题,企业需要说明它应该达到普通医生水平,还是专科医生水平。如果产品与医生共同工作,评价对象可能变成“医生 + AI”的组合表现。如果产品承担自主任务,则需要单独评价 AI 本身的表现。
这会改变临床验证设计。过去企业主要回答“算法指标是多少”,未来还要回答“应该和谁比、在哪个场景比、比什么能力”。

# 获批之后还要持续“再考试”
生成式 AI 产品获批后并不一定停止变化。
FDA 在讨论文件中提出,部分生成式 AI 医疗器械可能需要周期性重新基准测试、临床医生抽样复核、性能衰减监测。底层模型、输入人群、数据环境或系统配置发生变化后,企业需要判断产品是否出现漂移。
FDA 还提出一个监管取舍:是否可以在某些情况下接受更高的上市前不确定性,同时通过更强的上市后监测进行补偿。这个问题目前只是征求意见,不代表已形成政策。
如果这一思路未来落地,医疗 AI 企业对“注册”的理解会改变。过去,拿到 510(k)、De Novo 或 PMA 是一个明确节点;对于持续变化的生成式 AI 产品,注册能力、算法运营能力和上市后监测能力会逐渐合并。
生成式 AI 医疗器械证据链构成

# 第三方基础模型带来新的责任链条
很多医疗 AI 企业不会自研基础模型,而是调用第三方大模型。由此产生一个监管问题:如果底层模型由另一家公司升级,医疗器械企业如何及时发现、验证并控制风险?
FDA 在文件中提出,企业可能需要通过合同、技术接口、版本管理、变更控制计划等方式处理这类问题。
文件还讨论了 Foundation Model Device Master File,即基础模型器械主文件。按照设想,基础模型开发商可以自愿向 FDA 提交模型卡、系统卡等资料,由 FDA 保密保存;使用该模型开发医疗器械的企业,经授权后可以在注册申报中引用相关资料。
这不等于基础模型本身获得医疗器械批准。最终产品制造商仍要证明其产品在具体用途下安全有效。基础模型提供商可以提供底层资料,医疗器械企业仍承担最终产品责任。
# 对中国医疗 AI 企业的影响
中国已经有人工智能医疗器械注册审查框架。国家药监局器审中心 2022 年发布《人工智能医疗器械注册审查指导原则》,监管关注点包括训练数据、数据质控、算法性能、临床评价等。
FDA 这次讨论更具体地指向生成式 AI、基础模型和持续变化系统。准备进入美国市场的中国企业,至少需要提前回答三个问题。
第一,测试体系要从单项准确率扩展到完整能力边界。安全识别、拒答、泛化、多轮交互、沟通质量和工具调用,都可能进入验证范围。
第二,使用第三方大模型的企业,要建立可执行的版本管理和变更控制体系。底层模型更换版本后,不能只确认系统还能运行,还要确认临床性能和风险边界没有发生不可接受变化。
第三,上市后监测会成为生成式 AI 产品的核心合规能力。漂移监测、周期性再测试、临床抽样复核、真实世界性能跟踪,可能决定产品能否持续保持监管合规。
法规团队要更早进入产品研发。模型选型、系统架构、知识库设计、临床验证方案、上市后监测机制,都需要在产品成型前同步考虑。
# 结语
FDA 这次没有发布新的生成式 AI 医疗器械法规。文件集中讨论了几个关键问题:开放式输入怎么评、非唯一答案怎么比、第三方基础模型怎么管、产品持续变化后怎么监测。
生成式 AI 医疗器械的评价对象正在从固定算法,转向持续运行的临床能力系统。未来的证据链可能由能力测试、临床确认、模型变更控制和上市后持续监测共同构成。
FDA 已将意见征集开放至 2026年10月19日。对于准备进入美国市场的医疗 AI 企业,这份文件虽然还没有法律约束力,但已经可以用来检查现有产品和注册方案:能否说明能力边界,能否管理模型变化,能否证明真实使用中的持续安全有效。
重点企业与机构
▌知名医疗科技创新企业:美敦力 | 波士顿科学 | 开立医疗 | 爱尔康 | 微创机器人 | 罗森博特 | 科思明德 | 迈普医学 | 赛诺威盛
▌知名医疗科技创新服务机构:八大处整形医学概念验证中心 | 通和立泰


