周末文摘 | 美国FDA药品审评报告模板的演变对审评决策体系建设的启示


引用本文
周燕燕,林妍,谭娟,陈晓媛,杨劲*.美国FDA药品审评报告模板的演变对审评决策体系建设的启示[J].中国食品药品监管,2026(6):56-72.
美国FDA药品审评报告模板的演变对审评决策体系建设的启示
Implications of the Evolution of FDA Drug Review Report Templates for the Development of Drug Review Decision-Making Systems
周燕燕
中国药科大学国际医药商学院
ZHOU Yan-yan
School of International Pharmaceutical Business, China Pharmaceutical University
林妍
中国药科大学基础医学与临床药学学院
LIN Yan
School of Basic Medicine and Clinical Pharmacy, China Pharmaceutical University
谭娟
中国药科大学国际医药商学院
TAN Juan
School of International Pharmaceutical Business, China Pharmaceutical University
陈晓媛
清华大学药品监管科学研究院
CHEN Xiao-yuan
Institute for Drug Regulatory Science, Tsinghua University
杨劲*
中国药科大学药学院
YANG Jin*
School of Pharmacy, China Pharmaceutical University
摘 要 / Abstract
审评报告模板是连接监管决策与公众信任的载体。本文利用数据- 信息- 认知- 智慧(DIKW)模型,梳理并分析了美国食品药品监督管理局(FDA)药品审评报告模板从分学科审评报告模板到多学科审评报告模板,再到以关键科学问题为核心的整合审评报告模板的演变历程,探讨了人工智能工具在药品审评中的应用,以期为我国更好地推进药品审评工作提供参考。
Review report templates serve as an important vehicle linking regulatory decision-making and public trust. Using the data-information-knowledge-wisdom (DIKW) model, this paper reviews and analyzes the evolution of drug review report templates used by the U.S. Food and Drug Administration (FDA), from discipline-specific review report templates to multidisciplinary review report templates, and ultimately to integrated review report templates centered on key scientific issues. The paper further explores the application of artificial intelligence (AI) tools in drug review, with the aim of providing insights for advancing drug review practices in China.
关 键 词 / Key words
药品审评;透明度;审评报告模板;人工智能;监管科学
drug review; transparency; review report templates; artificial intelligence; regulatory science
基金项目
中国药品监督管理研究会课题(2023-Y-Y-008);中国食品药品国际交流中心委托课题(2024200923、20252002125)

药品审评报告模板为具体药品上市申请的技术审评提供了一种通用的结构化大纲与标准化格式[1]。基于审评报告模板生成的药品上市申请技术审评报告需要对公众公开,以呈现监管机构对药物获益- 风险进行评估并做出决策的过程,有助于公众、临床研究机构与产业界理解监管决策的证据支持与审评科学逻辑。审评透明度的核心在于实现从“结果可见” 到“ 逻辑可追溯” 的跨越[2]。
按照相关法规要求,监管机构需在法定时限内,基于海量的数据信息,完成对申办方提供的证据是否满足上市注册所需的证据标准(包括完整性和证据级别)、药品上市后在目标人群中获益是否大于风险及风险是否可控等问题的综合评估和判断。该过程依赖临床、统计学、药理毒理学、临床药理学与药学等多学科的技术审评协作。然而,各学科间的知识壁垒易导致信息割裂、认知偏差甚至判断冲突,可能会影响决策过程的协调性、一致性与透明度。
基于此,本文利用数据-信息-认知-智慧(data-information-knowledge-wisdom,DIKW)金字塔模型,将药品审评理解为从原始数据到监管决策的认知迭代过程,系统梳理了美国食品药品监督管理局(Food and Drug Administration,FDA) 审评报告模板从分学科审评到多学科审评、再到问题导向的整合审评的演变,并结合人工智能(artificial intelligence,AI)在审评中的辅助作用进行分析,以期为我国药品审评工作提供参考。

01
DIKW 金字塔模型与药品审评决策智慧
1.1 DIKW 金字塔模型概述
DIKW 金字塔[3] 是一个描述数据、信息、认知、智慧之间逐级提升层次关系的概念模型。最底层是数据,指未经处理、孤立的事实、符号或信号,由于缺乏语境,其本身不具备内在意义;第二层是信息,即被赋予背景、逻辑关系和特定含义的结构化数据,回答“是什么”的问题;第三层是认知,指经过结构化梳理、信息加工、总结规律、内化经验并可以指导行动的信息集合,解决“怎么做”的问题;第四层是智慧,是基于价值观、道德判断及系统思维的深层洞察所做出的综合判断与决策,高质量的信息加工才能形成洞察,其关注“为什么”以及长远影响。该模型揭示了从看见零散现象到理解内在本质,再到基于洞察做出决策的过程。
综上,DIKW 金字塔模型包括数据、信息、认知、智慧4个层次。原始数据经组织关联形成信息, 信息提炼归纳为可应用的知识, 知识在价值判断与前瞻思考下升华为智慧, 为决策与治理体系现代化提供理论依据。
1.2 采用DIKW 模型解读药品审评过程基于数据和信息的认知整合和决策智慧
药品技术审评是基于对大量研究数据和信息的分析和评估进行监管决策的过程[4]。DIKW 模型的4 个层级分别与审评工作的不同内容、深度和产出相对应(图1)。①数据层:申办方持有的、符合真实性要求与医药质量管理规范体系(GXP) 合规标准的原始资料, 包括受试者病例报告表、实验室检验的原始数值及生产记录等数据。②信息层:表现为申办方按照国际人用药品注册技术协调会(International Council for Harmonisation of Technical Requirements for Pharmaceuticals for Human Use,ICH)《M4 :人用药物注册申请通用技术文档(CTD)》(M4: The Common Technical Document for the Registration of Pharmaceuticals for Human Use) 指导原则定义的通用技术文档(common technical document,CTD)5 个模块结构提交的申报资料[5]。通过赋予数据以背景与逻辑,形成申办方视角下的结构化信息,这是技术审评中科学认知和判断的基础。③认知层:这是从申办方视角转向监管方视角的关键阶段。多学科审评团队对CTD 信息进行审查,为进入智慧层做好准备。审评团队通过跨学科协作(如药学、非临床、临床、统计学等),基于作用机制、量效关系、毒理关联等科学证据,对药物的有效性、安全性及质量可控性等进行评价,形成各自的专业判断。④智慧层:即监管决策阶段,旨在应对科学不确定性,做出符合公众健康利益的决策。最终的监管决策(批准、拒绝或者附条件批准)不仅基于科学认知,还综合考量了现有治疗、临床需求与社会价值,通过药品说明书、上市后要求、风险缓解策略等方式,实现对药品全生命周期的管理。

综上,采用DIKW 模型进行解读,药品审评可被理解为沿着DIKW 金字塔不断向上跃迁的认知过程:从原始数据到结构化信息,从规范认知到科学决策智慧,这一视角可为药品审评体系现代化建设提供清晰的理论路径。
1.3 药品审评中的不确定性管理
存在不确定性是药品审评科学决策中的常态。不确定性来源于很多方面,包括对疾病认知的局限、临床试验与真实世界之间的差异、样本量的有限、外推模型未经验证,以及生物学机制的复杂性等。可根据不确定性对证据强度和监管决策的影响程度,对其进行系统分类与应对(图2)。

高确定性/ 高影响程度(第Ⅰ象限):通常为证据确凿的关键问题,可依据明确的法律法规或技术指导原则直接决策。高确定性/ 低影响程度(第Ⅱ象限):属于常规信息,按标准流程处理即可。高不确定性/ 低影响程度(第Ⅲ象限):此类问题通常不作为审评的重点。高不确定性/ 高影响程度(第Ⅳ象限):此为审评的核心痛点与难点,通常直接关系到最终的获益- 风险结论,难以基于单学科审评或现有指南解决,需要通过跨学科深度协作进行综合评价分析[6](表1)。


以剂量选择为例,这是一个典型的、需要跨学科交流分析的第Ⅳ象限情境。随着药物特征复杂性的提升,降低监管不确定性所需的学科支持呈现出不同层次:①对于不良反应轻微、量效关系简单的药物,主要依赖于临床药理学与临床医学的协作,依据暴露- 效应关系即可确定固定给药剂量。②对于治疗窗较窄、剂量增加后毒性难以耐受的药物,剂量方案优化必须引入药物警戒、生物统计学与毒理学专家, 共同评估安全性风险,通过引入体重、肾功能等因素制定最终给药方案[7],在疗效与耐受性之间取得平衡。③对于需根据给药后临床响应动态调整剂量的药物[ 如根据抗凝血酶水平调整剂量的芬妥司兰(fitusiran)],则需要药理毒理学专家、生物统计学专家深度介入,进行安全性监测生物标志物的检测方法开发、临床探索与验证等审评工作。随着复杂性的增加,各学科之间的交流协作频次也需要相应增加。
不确定性的监管挑战还在于需要同时考虑对临床需求程度的评估。通过疾病自然史研究,可为外部对照和临床需求提供证据。当疾病满足“ 无有效治疗手段” 且“ 短期致死或严重致残”时,监管机构可以在样本量、终点指标、随访周期等方面接受一定的不确定性, 通过附条件批准、风险控制措施及上市后研究要求相结合的方式,实现“早期可及”与“安全可控”之间的平衡。
综上,在药品上市申请的审评决策过程中,通常需要基于科学逻辑进行数据和信息的整合,开展多学科协作审评。同时,也需要对各种不确定性进行处理和应对。对不确定性的有效管理,对于提高审评的准确性、科学性与决策效率至关重要。
监管机构可借助审评报告模板和其他结构化的决策工具[ 如美国FDA 的获益- 风险评估框架、欧洲药品管理局(European Medicines Agency,EMA)的获益- 风险效应表,以及问题界定、目标、替代方案、后果、权衡、不确定性、风险承受度及相关决策(problem formulation, objectives, alternatives, consequences, trade-offs, uncertainties, risk attitude, linked decisions,PrOACT-URL)模型等][8],识别并评估关键不确定性。其中,审评报告模板是引导审评过程中逻辑推理和智慧决策的常用且重要的结构化工具。

02
美国FDA 审评报告模板的演变
FDA 审评报告模板可作为一种结构化的认知引导和逻辑推理工具,辅助审评员系统性地完成从数据梳理、分析、综合评估到做出决策的全过程。基于审评报告模板,审评团队可对申办方递交的结构化注册资料进行系统性信息加工与跨学科整合,开展综合评价和监管决策,这一过程符合DIKW 模型的层级跃迁逻辑(图3)。从监管科学的视角看,审评报告模板不是简单的填空式表格,而是基于风险与问题的认知整合工具,通过结构化的引导,将临床、统计、药理等多学科的信息、证据与判断进行整合。

为解决传统分学科审评报告模板所导致的信息割裂问题,FDA 对其审评报告模板开展了一系列分阶段、持续而深刻的改革与演进。
2010 年前后,FDA 新药审评以分学科模式为主:临床、统计学、临床药理学、非临床,以及化学、生产和控制(chemistry, manufacturing and controls,CMC)等学科分别形成独立的“5+1” 审评文件。这种分工虽保证了各学科的严谨性,但在实践中逐渐显示出信息割裂、内容重复与决策协同不足等局限。随着基因疗法、靶向治疗和复杂生物制品的不断涌现,仅在审评结束时进行简单的意见汇总, 已难以对产品的安全性、有效性与质量可控性进行全面评估。为此, 在《处方药使用者付费法案》(Prescription Drug User Fee Act,PDUFA) 第六次重新授权周期(PDUFA Ⅵ ) 的承诺框架下,FDA 于2017 年启动了“新药监管计划(new drugs regulatory program,NDRP)现代化”改革[9]。为减少改革对正常审评秩序的冲击,FDA 采用了依据风险和难度分阶段、稳健推进的策略。改革首先尝试引入了多学科审评报告模板,即将各学科报告合并入同一份PDF文件中,并引入了协同撰写工具(collaborative authoring tool,CAT),以支持多人并行工作[10]。在此基础上,FDA 于2019 年推出了综合评估流程和整合审评报告模板(integrated review template,IRT)。以2018 年8月30 日采用多学科审评报告模板获批上市的两个药品(pifeltro、delstrigo) 为例[11],FDA 重新采用IRT 撰写报告,并将报告公开,展示了如何以关键问题为主线组织证据、在同一推理链条中呈现多学科判断的新范式。下文将对审评改革过程中各阶段审评报告模板的内容、流程、演变逻辑等进行详细阐述。

03
分学科审评报告模板
2010 年前后,FDA 的审评工作呈现学科孤立的特征。申办方按照CTD 结构提交新药上市许可申请(new drug application,NDA)或生物制品上市许可申请(biologics license application,BLA) 资料后, 药品审评与研究中心(Center for Drug Evaluation and Research,CDER) 组建上市申请审评团队[12]。通常由监管项目经理和一名临床审评团队负责人牵头,组织临床、统计学、临床药理学、CMC、非临床等学科审评员分别在各自专业范围内开展审查,并形成独立的、基于学科的“5+1”审评文件:临床审评报告、统计学审评报告、临床药理学审评报告、产品质量(生产和质量控制)审评报告、非临床审评报告,以及视情况而定的风险评估与缓解策略(risk evaluation and mitigation strategy,REMS)相关审评文件。各学科围绕其专业问题展开审评(表2),虽然确保了专业深度,但也导致了审评报告的独立性、割裂性与冗余性。

从流程运行机制来看,传统审评主要依赖少数关键会议实现跨学科信息对齐(图4)。提交/规划会议(审评开始后的30~60天内):确认申请资料的完整性,并初步识别与获益- 风险评估相关的关键问题;中期会议:讨论审评过程中出现的、可能影响批准结论的重大科学或监管问题;总结会议(审评结束前):整合各学科审评发现,审议具体技术争议(例如,临床与统计学审评部门在安全性分析中的分歧,药理毒理学与质量部门在杂质方面的讨论等),并形成最终审评建议,为相关人员做出最终决策提供参考。

这种并行处理的模式使得药品的一些可共享信息,如疾病背景、监管历史、药物作用机制以及临床试验设计,在每个学科的报告中被反复撰写。这不仅使审评专家耗费大量时间于重复的行政写作,而且药物整体的获益-风险权衡逻辑散落于各报告结论中, 使得外部读者难以拼凑出FDA 决策的完整逻辑图景,极大影响了审评结论的透明度和可理解性。
此外,在协作机制上,各学科撰写报告初稿完成后,再在规定时间进行交流碰撞,缺乏实时的跨学科互动,致使科学问题没有得到充分及时的探讨,从而降低了决策的效率与深度。

04
多学科审评报告模板
为解决信息碎片化问题,FDA 尝试引入多学科审评报告模板, 并试用了CAT[10]。CAT 作为一个云端协同写作平台,将冗长的审评报告分解为模块化章节,允许不同学科的审评专家在同一文件中并行工作。该平台按章节分段授权,赋予不同角色差异化的操作权限(包括编辑、注释、阅读):负责特定章节的学科审评员拥有排他性的编辑权限;协同专家仅能在关键段落添加专业批注或标记疑问,不能对原始文本进行修改;项目管理者拥有阅读权限,可实时查阅报告进展,但不能对文本进行编辑或添加注释。这一机制提升了撰写效率,也维护了监管的独立性。
然而,多学科审评报告模板的本质是将各学科的独立报告在形式上合并于一份PDF 文件中(表3),并未改变按学科排列的内部结构。其未能促成真正的跨学科科学对话,也未能有效提炼出决定批准与否的关键科学问题,因此无法清晰呈现监管决策背后的逻辑与权衡过程。


05
整合审评报告模板
5.1 整合审评报告模板概述
2019 年,FDA 正式推出了上市申请综合审评程序(integrated assessment of marketing applications,IAMA) 和IRT,作为NDRP 现代化的核心组成部分[13]。
IRT 的核心是以关键问题为导向。审评团队首先共同识别出那些直接影响获益- 风险评估的核心议题,并围绕这些议题进行跨学科交流沟通,利用CAT 技术实现在同一份文件中实时编辑。这不仅仅是文档格式的更新,更标志着审评模式从“以学科为中心” 向“ 以获益- 风险评估关键问题为中心”的根本转变。自2023 年10 月起,该流程和模板成为针对所有新分子实体(new molecular entity,NME) 和原创BLA 的强制性要求[ 肿瘤疾病办公室(Office of Oncologic Diseases,OOD) 除外, 其可选择使用IAMA 流程/ 模板或评估辅助工具][10]。
IRT 采用了金字塔式的三段结构(表4),旨在提升逻辑的透明度与信息的层级化管理。执行摘要:概述监管决策、主要获益与风险及其权衡逻辑,面向公众与非专业读者。跨学科评估:聚焦于关键审评问题,记录多学科证据整合与科学共识形成过程。附录:收纳技术细节与支持性材料,保证科学严谨性与可追溯性,同时确保主线逻辑清晰。

在流程层面(图5),审查小组通过获益-风险界定会议提前识别问题,并通过联合评估会议(joint assessment meeting,JAM)集体讨论关键议题,从而加强沟通与协作整合。

IRT 还建立了科学分歧处理机制:鼓励在审评过程中充分暴露并讨论分歧。对于已解决的分歧,在“跨学科评估”中记录讨论过程;对于未解决的实质性异议,则允许审评员在附录中提交独立报告,从而在保持决策透明度的同时尊重科学判断的多元性。
5.2 整合审评报告模板案例分析
5.2.1 背景与监管挑战
托夫生(tofersen,商品名为Qalsody) 是由美国Biogen公司开发的药物, 用于治疗超氧化物歧化酶1(superoxide dismutase 1,SOD1) 的基因突变相关的肌萎缩侧索硬化症(amyotrophic lateral sclerosis,ALS)( 以下简称SOD1-ALS)。该疾病属于进行性、致死性运动神经元病,患者多在症状出现后3~5 年内因呼吸衰竭死亡。美国总体ALS 发病率约为每年2/10万,年新增约6000 例,患病率约为5/10 万,存量约16 000 例;SOD1-ALS 在美国的患病人数少于500 例,A5V 等位点变异与极短生存期相关[14]。
在治疗现状方面,FDA 此前批准的3 种药物( 表5):利鲁唑(riluzole) 可延长生存期约3 个月[15] ;依达拉奉(edaravone) 适用于早期患者,可减缓机能下降约33%[16] ;relyvrio(苯丁酸钠+ 牛磺熊去氧胆酸)在24 周内可轻度改善修订版肌萎缩侧索硬化功能评定量表(amyotrophic lateral sclerosis functional rating scale-revised,ALSFRS-R) 评分[17]。然而,这些药物对SOD1-ALS 的特异性疗效有限,无法阻止疾病进展,且对晚期患者效果更差[18]。现有治疗无法逆转已发生的神经损伤,也缺乏针对特定基因突变的精准疗法。因此,针对SOD1-ALS 等特定亚型的靶向治疗仍存在巨大的未满足需求。

在对托夫生的审评过程中,监管机构面临极大的挑战(表6)。临床需求的迫切性:现有疗法(如利鲁唑、依达拉奉)仅能微弱延缓病程,无法针对病因治疗,且上述药物的说明书均标明其治疗ALS 的作用机制不明确。SOD1-ALS 患者面临无药可用的境况。确证性试验的统计学失败:关键Ⅲ 期临床试验(VALOR/Study 101C)的主要终点(ALSFRS-R评分,即患者功能评估)未能达到统计学显著性差异(P=0.97)。按照传统监管标准,这是一个明确的阴性结果。生物标志物的明显改善:药物显著降低了血浆神经丝轻链蛋白(neurofilament light chain,NfL)水平(降幅约60%)。

5.2.2 跨学科证据整合与决策逻辑
关键Ⅲ期临床试验(VALOR/Study 101C) 主要疗效终点未能达到统计学显著性差异(P=0.97)。在临床获益不明确的情况下,NfL 的显著下降能否作为“合理可能预测临床获益”的替代终点,从而支持该药物通过加速批准路径上市?为解决这一关键问题,各审评学科形成如下证据链。临床药理学:证实托夫生治疗后血浆NfL 降低67%,脑脊液(cerebrospinal fluid,CSF)中SOD1 蛋白降低38%,并通过因果模型量化出NfL 每下降10 pg/ml 可缓解ALSFRS-R评分恶化0.8 分。生物统计学:统计团队指出主要终点统计功效严重不足,相关性强度有限,且事后分析存在数据驱动偏倚风险。非临床:从机制层面桥接动物与人类数据, 证明反义寡核苷酸(antisense oligonucleotide,ASO)降解SOD1 信使核糖核酸(messenger ribonucleic acid,mRNA)可减少毒性蛋白的聚集,为NfL 作为药效学指标提供生物学合理性。临床医学:引入临床需求强度视角,强调SOD1-ALS在美国是患者不足500 例的致死性罕见病,现有疗法仅能延长数月生存期,存在重大的未满足需求,并将开放标签拓展Study102(NCT03070119) 中早期治疗组52 周时的功能与生存获益信号纳入考量。外部顾问委员会:以9 ∶ 0 投票表决认定NfL 为“合理可能预测临床获益”的替代终点。
最终结论:各学科证据从“未满足需求”到“生物学合理性”到“量效关系”到“风险可控”的审评逻辑进行整合,达成“基于NfL 可通过加速批准路径,但需要上市后要求(post-marketing requirement,PMR)确证临床获益”的共识(表6)。
在临床试验中观察到与鞘内注射相关的严重神经系统不良事件,包括脊髓炎、神经根炎、无菌性脑膜炎和颅内压增高(如视乳头水肿)。这些风险的发生频率与严重程度,在ALS 这种致命性疾病的获益- 风险框架下能否被接受?审评团队进行了如下跨学科审评。临床审评与药物警戒:识别确认治疗组中特异性的严重病例,如2 名患者发生脊髓炎,多名患者出现视乳头水肿。通过暴露调整发生率(exposure-adjusted incidence rate,EAIR)计算显示,脊髓炎在治疗组中的风险显著高于安慰剂组。同时发现,CSF 中蛋白质和白细胞水平的升高与这些炎症事件高度相关。非临床:在实验用猴长达9 个月的鞘内给药毒理学研究中,观察到轴突变性、神经炎症和神经元空泡化[ 未观察到的不良反应水平(no observed adverse effect level,NOAEL)为12 mg]。该结果证明了神经系统炎症反应具有生物学基础,并确认了临床观察到的不良事件与ASO 药物浓度及其给药方式(鞘内给药)直接相关。临床药理学:提出药物在CSF 中的局部暴露量可能是引发炎症的关键。通过分析CSF 动力学,探讨了给药间隔与炎症信号的关联。生物统计学:对安全性数据进行分组分析,证实了这些严重神经系统不良事件仅发生在托夫生治疗组,而非安慰剂组,排除了疾病自然进展的可能性。
最终结论:审评团队基于跨学科证据一致认为,鉴于SOD1-ALS患者面临巨大的未满足需求,在提供严密临床监测的前提下,该风险是可接受的,不需要额外的REMS,但需要在说明书的“警告与注意事项”中标明神经系统炎症风险。
5.3 整合审评报告模板的优势
IRT 的核心优势在于实现了从学科独立到问题整合的跨学科协作模式转变(图6)。通过结构化引导,多学科专家围绕关键科学问题协同工作,减少重复劳动,并将审评重心从数据罗列转移至导向监管决策的获益- 风险评估和科学依据阐述上。

IRT 采用三段式结构:执行摘要概述监管行动、重大决策及其理由,并以获益- 风险框架凝练主要获益与风险及其权衡;跨学科评估部分聚焦与决策最相关的安全性、有效性等关键问题,形成整合讨论与可审计的推理路径;附录作为支撑性材料库,保留主题专家审评、监管历史、标签总结和补充分析,使详细证据可追溯而不淹没主线。
此外,该体系引入了医学编辑与临床数据科学家等新角色,将编辑排版与数据整理等支持工作专业化,使审评员更专注于核心科学判断与获益- 风险评价[19]。
IRT 通过促进跨学科深度协作、增强决策逻辑透明度、合理保留科学分歧,显著提升了审评效能、决策一致性与监管公信力,代表了药品审评现代化的重要发展方向。
综上,FDA 审评报告模板的演变,体现了审评决策的进化:从“重数据收集”转向“重信息整合”,从“分散信息”上升为“整合证据体系”,从“经验审评”提升为“以获益- 风险评估为核心的决策框架和智慧决策”,实现了数据、信息、认知、智慧的完整转化链条,也为我国药品审评构建现代化科学监管体系提供了可借鉴的实践范式。

06
人工智能辅助下的审评
早在2017 年,为解决药品质量审评依赖“ 自由式叙述文本” 所导致的效率低、一致性差、知识管理困难等问题,FDA启动了“ 知识辅助评价和结构化申请(knowledge-aided assessment and structured application,KASA)”[20] 系统建设。该系统将非结构化的监管和技术评价文本转化为结构化数据,基于传统的AI 和机器学习技术,内置知识驱动的规则引擎、模式识别,以及失效模式、影响和危害性分析(failure mode, effects and criticality analysis,FMECA)模型等,捕获并管理关于原料药、制剂、制造及设施的风险及其控制策略信息。该系统正在按计划有序推进,致力于药品全生命周期内现代化药品制造评估能力建设。值得注意的是,该审评辅助工具未采用生成式AI和大语言模型(large language model,LLM)。
AI 通过计算机程序或者硬件模拟人类智能,旨在让机器可以像人类一样思考与行动。所谓传统AI,是指基于明确规则(依赖人类专家的经验)、逻辑推理或特定算法完成预设特定任务的AI 系统,如制药工艺风险评估等。而LLM 在自然语言处理、知识问答、多轮对话与生成式内容创建方面展现出强大的语义理解和生成能力[21],已成为AI 研究与应用的核心技术之一。随着LLM 的快速发展,FDA 也在尝试将其引入包括临床审评在内的审评工作流程。
2025 年6 月,FDA 部署了基于生成式AI 的内部工具Elsa,其核心目标是自动化或半自动化处理耗时、重复性高但又至关重要的任务,从而将FDA 专家的宝贵时间解放出来,使其更专注于需要深度分析、批判性思维和科学判断的核心监管决策工作[22]。
Elsa 不同于商业聊天机器人, 其基于Anthropic 公司的Claude 模型构建,并部署在亚马逊云科技的高安全性GovCloud环境中。Elsa 可辅助审评员完成阅读、写作与摘要等任务,从而显著减少资料阅读时间,将专家精力释放到获益-风险权衡、不确定性评估与跨学科争议解决等更高阶环节。
需要明确的是,并非AI 技术倒逼审评报告模板改革,而是结构化的审评报告模板为AI 的应用创造了先决条件。在当前审评框架之下,AI 可在以下环节发挥显著作用:①辅助审评员建立专业知识库,实现对审评历史知识的快速查询。②辅助完成学术报告、摘要的润色与逻辑组织,提升长文本的处理效率;能自动从海量文献与审评材料中提取并结构化关键信息,大幅节省阅读与筛选时间。③对于高确定性、高影响且具备法规或技术指导原则的问题,AI 可基于预设的规则自动识别是否符合技术标准。④自动汇总不良事件、跨文档检索与要点提炼、辅助生成数据查询代码等(图7)。

然而,AI 的能力存在明确边界。生命系统是高度复杂的网络,药物介入后引发的系统动态响应, 涉及细胞内脱氧核糖核酸(deoxyribonucleic acid,DNA)、信号网络等复杂的生物学规则,这是目前基于概率和已有数据训练的AI 所无法模拟的。因此,在面对非预期不良事件、获益- 风险权衡以及因果关系判断时,AI 无法替代人类专家的认知与洞察。
监管决策既是科学判断,更是行政行为。现行的法律法规尚未授权AI 进行实质性审批。因此,AI 被严格定位为辅助工具,不能替代人类进行决策。最终的共识形成及伦理考量,仍须由人类审评员主导,以规避AI 可能产生的“幻觉”风险。

07
展望与启示
公开药品上市技术审评报告,不仅有助于研发企业理解监管机构的科学观点与决策依据、指导研发方向,也能够促进公众参与和监督。近年来,我国药品审评审批透明度建设主要通过国家药品监督管理局药品审评中心(以下简称国家药监局药审中心)官网等平台推进,在公开手段、范围与时限上已形成基本框架。根据《药审中心技术审评报告公开工作规范(试行)》规定[23],国家药监局药审中心在新药获批上市后6 个月内完成技术审评报告公开,即通过国家药监局药审中心网站公开新获得批准的新药技术审评报告和药品说明书。新药包括创新药和改良型新药,以及获准进口的境外上市的原研药品和改良型药品,中药新药还包括古代经典名方中药复方制剂。对于涉及商业秘密的信息依法予以保密,但关键质量属性、有效性与安全性结论等关乎公众健康的核心信息均应公开。然而,与国际高标准的监管透明度相比,我国当前在公开的及时性与决策逻辑的呈现上仍有提升空间。
结合我国监管实际,笔者提出以下对策思考。一是可考虑制定审评报告改革战略和实现路径图。可构建整合式、数字化、智能化审评新模式。突出对关键问题的多学科证据融合与逻辑推演,推动审评逻辑转型与升级。同步优化审评流程,建立跨学科联合审评机制,在报告中明确争议问题、会商结论与决策依据,从而全面提升审评质量与效率。二是建议扩大审评信息可公开范围,提升监管透明度与社会公信力。在严格保护商业秘密与个人隐私的前提下,稳步扩大药品审评报告公开范围。适当公开审评过程中的科学分歧,因为真正的透明度不仅仅是结论公开,还需要呈现决策过程。建议适当公开审评过程中的争议问题和专家咨询会议中的讨论焦点。通过信息公开引导企业规范研发申报行为,减少沟通成本与政策不确定性,提升医药产业对审评审批的可预期性。同时,主动接受社会监督,增强药品监管权威性与公信力。三是建议提升公开的及时性。针对当前审评报告发布存在的时滞现象,建议在保障信息准确与完整的前提下,探索优化内部流程,缩短报告整理与发布周期,逐步向国际通行的“获批即公开”模式靠拢。四是推动监管工具与方法现代化。立足我国医药创新与数字技术发展现状,可探索制定AI 辅助药品审评的规则与标准。可积极引入信息化、智能化技术手段,将专家资源从重复性劳动中解放出来,专注于获益- 风险评估,从而提升审评效率与报告质量。五是建议细化商业秘密的边界,进一步明确商业秘密的界定标准与处理程序,对于涉及安全性风险或关键疗效判断的数据,应在权衡后尽可能公开,避免因过度保密影响决策逻辑的完整呈现。
综上,FDA 药品整合审评流程和审评报告模板的演进是一个不断迭代的过程,已基本形成以获益- 风险为核心,跨学科整合、结构化、标准化、全生命周期管理、AI 辅助的现代化药品审评科学决策体系。这对于我国完善药品审评制度、提升监管现代化具有重要参考价值。通过制度优化与AI技术赋能,我国药品审评部门将逐步构建既符合国际发展趋势、又具有中国特色的药品审评公开与科学决策体系,持续推动医药研发创新与监管能力提升,更好地服务于公众健康与医药产业高质量发展。

第一作者简介
周燕燕,硕士研究生,中国药科大学国际医药商学院。专业方向:国际药品注册研究
通讯作者简介
杨劲,博士,中国药科大学药学院,教授。专业方向:药物代谢动力学、药品监管科学研究

【参考文献】详见纸刊。




编辑:向丽
审核:赵燕宜

