AI4Science新动向:从分子设计Agent到蛋白设计自动化
单击上方“图灵人工智能”,选择“星标”公众号
您想知道的人工智能干货,第一时间送达

图片来自uw.edu
潘 展 | 撰文
近期,AI for Science最新动态显示,行业正在走一条清晰的技术演进路径:AI模型从单点预测和生成,逐步发展为能够调用工具、组织科研流程并接受实验反馈的科技智能体。
与此同时,蛋白设计、材料发现和计算化学等方向正在形成“模型—Agent—实验”的闭环。产业端也出现相应变化,资本更加关注基础模型与Lab-in-the-Loop基础设施。
当前这些系统大多仍处于科研发现和前临床阶段。Agent能否持续产生经过实验验证的新知识?这些成果能否最终转化为候选药物、材料或可复现的科学发现?
最新研究:分子设计Agent
1.CAi Copilot:让AI从“分子生成工具”走向分子设计Agent
8月7日,上海人工智能实验室与南京大学团队发布 CAi Copilot,这是定位于早期小分子设计的专家型Agent。它能将研究者的设计意图转化为可执行、可追踪的科研流程,此模型由Research Interface、Agent Reasoning、Execution Substrate三层组成,协同完成分子生成、筛选、多目标评价和证据整理。

研究在CAiMD 45项任务上进行测试,覆盖IDH2骨架修饰、JAK1/JAK2双靶点设计和PDK1先导优化等场景。CAi总体目标满足度达到84.59%,较第二名高18.07个百分点,有效工具输出率达到67.49%,比最佳对照高32.58个百分点。此外,在SMDD-Bench部分任务中,先导优化成功率由50%提高至63.3%。

模型框架图,图源:论文
其重要意义在于,AI分子设计正从“预测一个结果”转向自主组织一系列科研操作并形成候选物证据链,但目前仍主要停留在计算环境,尚无湿实验和药物候选物验证。
参考链接
https://arxiv.org/abs/2608.06961?utm_source=chatgpt.com
2.OmniScientist:让AI Scientist直接面对原始科学证据
8月13日,多机构研究团队发布OmniScientist,提出一种“全模态、全学科”AI Scientist。系统由1个感知层+3个自主Agent构成,分别负责研究构思、实验分析和论文撰写,并通过确定性流程对新颖性、统计严谨性、执行记录和数值可追溯性进行检查。

研究在36个真实数据案例、5个学科族、4类科学证据上测试,覆盖图像、信号、音频、视频、3D结构、轨迹、表格、公式和图等多种模态,最终全部案例均完成从原始数据到编译论文,平均论文评分达到6.3/7。与仅提供预计算标量特征的盲测版本相比,直接感知原始数据在7项评价指标上全部改善,并在成对比较中取得85%的胜率。

模型框架,图源:论文
其核心意义在于突破传统AI Scientist依赖文本和结构化数据的限制,使AI能够直接从原始科学证据中发现问题、设计计算实验并形成结论。
参考链接
https://arxiv.org/abs/2608.13558?utm_source=chatgpt.com
3.ProteinDPO:让蛋白生成模型直接学习实验数据
8月14日,Stanford University与Arc Institute团队发表 ProteinDPO。该模型基于结构条件蛋白语言模型ESM-IF1,采用Direct Preference Optimization(DPO)将实验fitness数据直接融入生成模型。

研究从184万个序列变体中筛选出约66万条、覆盖403个蛋白结构域的数据进行训练。稳定性预测中,ProteinDPO的Pearson相关系数达到0.72–0.73、Spearman相关系数0.69–0.72,明显优于原始ESM-IF1的0.55和0.53;AUROC达到0.82–0.84。在H5N1血凝素稳定化实验中,仅测试45个设计便获得27个稳定变体,约80%设计达到或超过天然蛋白稳定性,熔解温度最高提高17°C;针对H5N1毒株,最高提升达到32°C。

模型框架,图源:nature methods
ProteinDPO的关键意义在于建立了“实验fitness→模型对齐→蛋白生成→实验验证”的闭环,为蛋白药物、抗体和疫苗抗原设计提供了可持续迭代的新路径。
参考链接
https://www.nature.com/articles/s41592-026-03137-3?utm_source=chatgpt.com
4.MAESTRO:让AI Agent自主完成材料发现全流程
8月20日,清华大学研究团队发布MAESTRO,构建了一个面向金属有机框架(MOF)材料发现的端到端LLM Agent系统。

MAESTRO首先从约40万篇MOF相关文献中提取信息,将论文与晶体结构关联,并通过多工具交叉验证建立包含约64000个可计算结构的数据库。随后采用“低成本预筛→Widom插入→GCMC→孔道分析→工艺模拟”等逐级增加计算成本的流程进行筛选。在湿烟气CO₂分离任务中,系统发现的11个优选候选材料全部来自与CO₂分离无直接关联的既有研究,其中候选材料在相对湿度RH=1.0条件下仍保留约93.7%–98.8%的干燥条件CO₂吸附能力,而对照材料CALF-20仅保留约6.5%。

模型框架图,图源:Materials Science
MAESTRO的意义不在于单纯提高某一个材料预测模型的准确率,而是利用Agent连接文献挖掘—数据库构建—计算模拟—多级筛选,从分散的科学知识中寻找传统关键词检索难以发现的材料。
前沿创新:蛋白设计自动化
1.Claude自主蛋白设计:通用AI开始进入蛋白设计闭环
8月18日,Anthropic公布Claude自主蛋白设计实验,由Claude Mythos Preview和Opus 4.8自主调用多个专业蛋白结构、序列设计及共折叠模型,在15个靶点、1,320个设计中获得354个binder,总体命中率26.8%,其中14个靶点至少获得1个binder。单靶点模式下,Mythos Preview命中率最高达35.1%,而目前蛋白设计通常约为10%–15%。针对RBX1,命中率达到40%,而此前竞赛参赛者为3.7%。实验由Adaptyv Bio和Twist Bioscience独立完成,Claude在48小时任务中最多调用12500个NVIDIA H100计算小时,基本自主完成靶点选择、结构/序列设计、计算优化和候选筛选。

两模型苗头分子命中率比较,图源:Anthropic官网
该研究意义在于,通用AI首次较完整地连接了科学推理→计算设计→实验验证,显示其可能成为蛋白药物发现的新型入口。但目前还处于binder结合能力验证阶段。
参考链接
https://www.anthropic.com/research/Claude-accelerates-protein-design?utm_source=chatgpt.com
2.SAPP + DMX:补上AI蛋白设计的“实验验证瓶颈”
8月20日,华盛顿大学蛋白质设计研究所(IPD)David Baker团队发表 SAPP+ DMX半自动化实验平台。SAPP将蛋白生产、纯化和标准化表征流程模块化,可实现每天数百种设计的毫克级生产与检测;单轮流程约48小时,实际需要人工操作约6小时,实验通量较传统流程提高至少一个数量级。

DMX利用寡核苷酸池生成经过序列验证的克隆,将基因合成成本进一步降低约5倍,可实现1000个以上设计、约5美元/个的纯化和表征。该体系已用于数十个项目、累计数万种从头设计蛋白的实验验证,并成功筛选出可有效中和呼吸道合胞病毒的全新binder。

SAPP工作流程示意图,图源:nature communications
其核心意义在于解决AI生成能力快速提升后日益突出的“实验验证速度不足”问题,为Protein AI接入自动化实验、持续产生高质量实验数据提供基础设施。
参考链接
https://www.nature.com/articles/s41467-026-76740-9?utm_source=chatgpt.com
3.AI-designed minibinders:AI从头设计肿瘤靶向微型结合蛋白
8月20日,德国波恩大学等团队建立了一套“AI设计—高通量筛选—实验优化”流程。

该研究利用RFdiffusion生成70–88个氨基酸的微型蛋白骨架,再通过ProteinMPNN设计序列、AlphaFold2/Chai-1进行结构和结合预测,针对PD-L1、CD276(B7-H3)和VTCN1(B7-H4)设计并筛选约1,000个候选分子。实验显示,PD-L1 靶点三款minibinder中BN_1358的结合亲和力达到KD=2 nM,另两种候选分别为87 nM和227 nM。团队进一步将minibinder用于CAR-T后发现,单纯提高靶标结合力并不足以保证功能,通过遗传算法优化非结合界面及等电点(pI),可改善细胞表面表达并增强靶向肿瘤细胞杀伤。

工作流程示意图,图源:nature communications
该项目意义在于可通过大规模实验筛选和迭代优化,将其转化为流式检测工具及潜在CAR-T识别模块,为传统抗体之外的小型、可编程蛋白药物和细胞治疗分子开发提供新路径。但研究同时表明,AI设计成功率具有明显靶标依赖性,真正实现治疗应用仍需解决表达、稳定性和体内功能等问题。
参考链接
https://www.nature.com/articles/s41467-026-76760-5?utm_source=chatgpt.com
4.Automated synthetic cell-based screening
该项目由德国马克斯·普朗克生物化学研究所团队于8月发表,核心平台 PUREdrop 将计算蛋白设计、无细胞表达、微流控和自动成像结合起来,实现复杂蛋白功能的高通量筛选。

平台可将不同DNA构建体封装进约20 μm直径的油包水液滴里,每个构建体产生数百至数千个“合成细胞”,并分配至96孔板进行约15小时的时间序列成像。单次反应仅需约0.87 μL,PURE系统试剂即可生成约3×10⁵个液滴,较人工乳化节省约7.4倍试剂;48孔运行约需5小时。研究利用AI重新设计的细胞分裂蛋白FtsZ进行验证,成功识别出具有不同聚集表型和动力学的变体,并发现可使FtsZ形成环状结构的调控组合。

平台流程示意图,图源:nature communications
该项目的重要意义在于突破传统蛋白筛选只能检测单一分子功能的限制,将AI设计—自动实验—时空表型测量连接起来,为复杂蛋白功能和合成细胞的闭环优化提供了新工具。
参考链接
https://www.nature.com/articles/s41467-026-76787-8/figures/1
融资与BD:Chai与BMS的强强合作
1.Chai Discovery × BMS:AI抗体发现进入大型药企研发体系
8月20日,Chai Discovery与大型药企BMS宣布合作,利用Chai的分子折叠与生成设计模型推进BMS治疗性抗体发现,并进一步建设AI驱动、持续学习的抗体发现系统。双方未披露具体交易金额和候选药物数量。
Chai此前已与Novartis、Pfizer、Eli Lilly、argenx等多家大型药企开展合作;2026年7月公司刚完成4亿美元C轮融资。Chai公开数据显示,其抗体设计已实现10%以上的成功率,微型蛋白设计成功率可达50%以上,部分设计流程可在2周内进入表征阶段。

此次合作证明,AI蛋白设计正从模型Benchmark和科研验证进入大型药企真实抗体研发体系。同时,利用BMS真实的实验数据,有望形成“AI设计—实验验证—数据学习—再设计”的闭环,具有较强的行业示范意义。
参考链接
https://www.chaidiscovery.com/news/bms-partnership
2.Aureka Biotechnologies 1亿美元B轮融资
Aureka Biotechnologies公司于8月10日完成1亿美元B轮融资,由Granite Asia独家领投首轮,后续轮次由一家战略投资者领投,HighLight Capital及原股东MPCi、NRL Capital跟投。公司自2023年成立以来累计融资已近2亿美元。

本轮资金主要用于下一代生物基础模型的大规模训练,提升从头分子设计、生物结构建模和功能预测能力,同时升级Lab-in-the-Loop实验闭环,将AI 智能体、单细胞功能筛选、高通量实验和药物开发连接起来。公司现有AuraIDE模型基于内部蛋白质协同进化数据训练,其开源版本OpenDDE在第三方生物分子模型评测中表现突出。
此次融资的意义不仅在于金额较大,更体现资本对“基础模型+自动化实验+真实生物数据”路线的认可。Aureka试图让实验室从AI模型的验证环节转变为模型持续学习的数据引擎,形成“设计—实验—反馈—再训练”的循环。模型规模化后,有望推动AI制药从单点预测工具向能够理解、生成并干预复杂生物系统的基础设施演进。
参考链接
https://aurekabio.com/news/61?utm_source=chatgpt.com

文章精选:
1.图灵奖得主姚期智最新演讲: AI有边界,恰恰是好事
