日本PMDA谈AI监管:治理框架、应用实践和“人在回路”

*题图仅做示意用
随着药品与医疗器械监管复杂性的提升、数据量的剧增以及社会对科学监管期望的增加,日本医药品和医疗器械管理局(PMDA)正积极推进生成式人工智能(AI)在机构业务中的应用。
在近日发布的文章《PMDA在运营中主动采用生成式人工智能(AI):当前举措、治理和未来展望》中,PMDA工作人员希望在保障科学严谨性与社会信任的前提下,通过引入生成式AI提升行政与审评效率,进而将人力资源更多地集中于需要高度科学判断的业务领域。
2025年PMDA发布《PMDA 运营中 AI 应用的行动计划》,为生成式AI的阶段性引入、组织治理与风险控制奠定了制度基础。这篇文献透露更多细节,但也可以看出PMDA对导入AI持有相当谨慎的态度,尤其在场景复杂和风险较高的科学审评领域。
更多全球药监AI监管动态可见专题文章。
首先搭建内部治理框架:首席AI官牵头,业务部门探索
PMDA构建了由高层领导决策、专业部门统筹、基层代表参与的多层次治理结构。
PMDA设立了首席AI官(Chief AI Officer),并在理事会的战略指导下行使最高决策权,负责确立AI应用的总体行动计划并作出重大行政决定。在信息系统与管理监督本部下,机构成立了由理事级人员组成的“AI导入与应用工作组”,承担集中管理职责,具体负责AI相关政策的制定、内部规章制度的立废、信息安全标准的审核以及机构级资源的调配。
为防止技术应用与实际业务脱节,PMDA设立了由各业务部门员工代表组成的“AI业务工作组”,成员覆盖审评部门、安全对策部门、健康损害救济部门及行政管理部门,负责跨部门分享生成式AI在实际操作中的成功经验与失败教训,评估业务需求的契合度,并配合推动员工AI素养与信息技术能力的教育培训。此外,各业务部门在日常工作中通过数字聊天工具保持横向沟通,同时根据处理信息的敏感度与性质建立起定期的上报机制,使得AI工作组能够快速响应业务部门遇到的安全、技术与流程问题,实现从战略决策到业务落实的双向畅通。
MS Copilot用于管理效率,专用AI用于科学任务,但更多是检索与写作
在具体实践方面,PMDA将生成式AI的应用划分为三大支柱和两个主要阶段,深度融入药品与医疗器械监管的整个生命周期管理中。
三大支柱构成了PMDA推动生成式AI应用的核心框架。第一支柱聚焦于基础行政效率的提升,引入成熟的商业化生成式AI工具。第二支柱关注专业审评能力的增强,通过在封闭安全的内部环境中部署专有大语言模型及开展概念验证(PoC)研究,辅助进行临床数据分析、审评报告草拟及安全性信号检测等高专业度任务。第三支柱致力于强化组织治理与能力建设,通过健全内部规章与安全标准,设立专责工作组并开展员工AI素养培训,确保AI应用在严密的风险管控下安全、合规运行。
与三大支柱相应,第一阶段重点在行政支持业务中导入成熟的商业化生成式AI工具(如Microsoft Copilot),主要用于提高会议纪要撰写、多语言监管文献与申报材料翻译、法规资料检索以及数据技术性校验等通用管理业务的效率。在信息发布阶段,AI也能够协助草拟面向公众、医疗从业人员及制药企业的信息发布材料与科普文本,提升监管透明度与公共沟通效率。
第二阶段则在安全的内部专用环境中部署专有大语言模型(如结合日本国内SIP-JMED等医疗专用大语言模型研究成果),用于辅助处理具有高度专业性、上下文依赖度高的医药科学审评任务。在分析与评估阶段,AI被用于临床试验数据的清洗、数据分析程序的开发与调试以及复杂临床与非临床数据的辅助分析。
目前,PMDA正开展针对新药审评的PoC研究,测试生成式AI在自动汇总临床试验结果、生成审评报告初稿方面的表现,以减轻审评人员的撰写负担。此外,AI还在药品不良反应信号检测和历年科学讨论记录检索中展现出应用潜力。
风险防范:“人在回路”与概念验证指标
PMDA对生成式AI的技术局限性与潜在风险保持高度警惕,制定了严格的控制措施。首先,PMDA明确坚持“人在回路”(Human-in-the-Loop)原则,将生成式AI定位为辅助性工具,严禁其替代人类的专业判断。所有最终的监管决定、安全性评价结论及其相关法律与科学责任,必须完全由PMDA的专业人员承担;对于未经充分验证的模型输出或试图直接替代人类决策的应用场景,机构一律予以禁止。
针对数据安全与机密信息保护,鉴于审评与安全监管涉及大量商业机密、未公开的研发数据以及患者个人健康信息,PMDA要求所有专业级AI模型的运行必须在封闭、安全的内部网络环境中进行,严禁将敏感数据传输至未经安全认证的公共网络或第三方服务器。
面对大语言模型可能产生的“幻觉”问题,PMDA要求使用者必须对AI生成内容的真实性与准确性进行逐条核对,确保所有生成的文本和数据都能精准追溯至原始申报资料或权威文献来源。
PMDA对每一个拟引入的AI应用场景实施阶段性的PoC,建立了包含业务耗时节省、文本摘要准确度、模型幻觉发生频率、人工修正率、源文档可追溯性、用户满意度以及信息安全合规度的多维度评估框架,只有在综合评估中兼具性能指标与成本效益的应用,才会获准进入实际业务流程。
识林®版权所有,未经许可不得转载
识林网址:www.shilinx.com
