Anthropic发布“硬件版MCP”:Claude 操控物理世界,8小时跑通数周集成

过去一年,Agent 已经把浏览器、终端、代码库和各种软件工具接管了一个遍。现在,Anthropic 将触手伸向了物理世界的硬件接口。
8 月 28 日,Anthropic 正式发布模型硬件标准(Model Hardware Standard,简称 MHS)的研究预览版。这是一项旨在让 Agent 安全且快捷地操控物理设备的底层通信规范,首批接入方为顶尖科学实验室和先进制造商。

物理世界的“USB-C 接口”
MHS本质,是一套面向物理硬件的标准化驱动程序和通信协议。它要解决的问题很具体:实验室里设备互长期存在语言不通的顽疾。显微镜由MATLAB控制,相机用Python,电生理设备跑C#,每台设备都有自己的编程接口,却没有统一标准。
过去,把这样一套自动化系统部署好,通常要几周到几个月,还得靠自动化工程师写定制代码。在生物实验室,这意味着大量实验仍然靠人工。一位博士生要每90分钟去换一次PCR板,凌晨4点也不能例外。一位显微镜研究员启动实验要按固定顺序打开七款软件,顺序错了,整个实验报废。
现在,MHS 将终结这种混乱,它的技术骨架由三层支撑:

标准化驱动。每台设备装上一个MHS驱动程序,用“读取”(比如获取当前温度)、“写入”(比如设定目标温度)这类极简指令统一设备的“语言”。设备以标准格式注册后,可以跨网络被Agent自动发现——不再需要一对一写定制代码。
自然语言标签。机械臂有多重、最大转速是多少、能加热到几度——这些关乎安全、但代码里读不到的物理信息,过去散落在纸质手册和老师傅脑子里。
MHS允许用户直接用大白话写进标签(也可以让AI通过聊天替你生成),系统据此自动生成一份“参考文件”。Agent读完这份文件,就能操作一台它这辈子从没见过的设备。
三种调用通道。设备接好后,Agent通过MCP、命令行或代码文件(API)统一调度,一行代码就能协调多台设备协同工作。

这里有两个信息值得重点关注:首先,MHS与基础模型无关,意味着任何Agent框架都能接入——它不是Claude的专属配件,而是Anthropic在抢“硬件行业标准”的位置;
其二,MHS和MCP是上下层关系——MCP负责Agent够到软件工具,MHS负责Agent够到物理设备。折页意味着,Anthropic的Agent协议栈第一次走出了数字世界。
你可以把它直接理解为物理世界 AI 设备的“USB-C 接口 + 即插即用协议”。大模型不需要预先认识这台机器,只需扫一眼这份标签文件,就能瞬间掌握设备的安全边界和操作逻辑,并通过一行代码跨网络统一调度多台仪器。
科研一线的工作验证
摆脱了定制化接口的障碍,MHS 在 CMU、 基因泰克(Genentech)等早期科研测试中展现出了颠覆性的工程效率提升。
暴力突破精度与速度(QuEra 量子计算)
最有戏剧性的结果来自QuEra。量子计算机的激光频率必须锁定在一万亿分之一的精度,相当于地月距离误差不超过一根头发丝。温度、振动、有人开个门,都可能让激光失锁。人工恢复需要5到10分钟,操作者必须同时盯几台仪器,判断哪里出了问题、先动哪个旋钮。
QuEra之前有个四人团队花几个月写自动化脚本,成功率58%,单次约150秒。
现在,QuEra把问题交给了Claude。通过MHS,Claude能读取仪器、操作旋钮。四个Claude实例组成了循环:一个提假设、一个改脚本、一个跑实验、一个读日志。循环在一夜之间迭代了数百次。到早上,恢复时间从150秒降到约6秒,成功率从58%提到96%。后续盲测700次,成功695次,99.3%。
Claude的核心改进是把线性恢复步骤改写成了决策树:先读仪器状态,判断扰动类型,再走对应分支。人工操作时,即使扰动很小,也必须把每个控制都检查一遍,因为只有查过才能确认。Claude靠反复制造扰动找出了规律,速度是任何操作员都做不到的。

调参环节更夸张。激光伺服环路有12个PID参数,专家先前调出的参数残余误差15.7mV。Claude用16小时做了363次实验,把它降到1.55mV,约降10倍。独立验证显示,Claude的参数连续19小时不失锁,专家参数平均每小时失锁1.6次。
Claude还找到了一处约220kHz的共振峰,专家手动调参漏掉了,那里的噪声高约千倍。用RMS误差近似做判断,容易踩这种坑,而Claude每次调整后都直接算全频谱,不需要靠近似。
八小时碾碎数周壁垒(CMU & Janelia)
CMU团队遇到的环境更极端。三台电脑控制三种设备,接口互相不兼容:机械臂的调度软件只认文件目录,液体处理器走老式Windows COM脚本,读板器根本没有编程接口,只有GUI界面。MHS把三种控制风格统一成一套状态和操作描述。从零写驱动加编排层用了8小时,厂商集成类似的设置通常要几周。
第一轮剂量反应曲线在高端浓度饱和,拟合R²小于0.9。AI自己判断不合格,倒掉重来,把最高浓度从200µg/mL压到100µg/mL,第二轮R²大于0.98。全程无人介入。团队还诱导了六种故障(板子缺失、板子放反、读板器忙、相机断连、设备不可达、急停生效),系统全部在设备动作前拦截。


Janelia的案例展示了MHS的灵活性。显微镜装置由七种软件控制,研究员以往要写大量桥接代码,有时还得加硬件转接。用MHS后,启动实验从七步变成一次点击。后来新加一台相机监测激光束,只花了几分钟。
MHS的来源也有点意思。它最初是Janelia一位博士后Arco Bast为解决自己显微镜设备不互通,搞了一个共享内存字典,让设备之间以内存速度通信。Anthropic的Alek Kemeny参与后,把AI模型接入了这个接口。
实验流程的自动化接管(Genentech & UW)
Genentech(基因泰克)拿BCA蛋白定量实验做了验证。这个流程要协调液体处理器、机械臂、读板器三个设备。Claude负责编排,自己试流速、测吸光度,和专家的结果对比算误差。
水和粘性蛋白样品最终分别收敛到约140µL/s和10µL/s,误差为0.016和0.181的RMSE。专家确认参数合理。这个参数优化过程,以前需要自动化专家为每个参数集写定制逻辑。
但Claude也暴露了物理直觉的短板。液体出现气泡时,它的第一反应是原地重试,结果越搅气泡越多。研究者介入后,告诉它要换到干净孔位、减少混合次数,它才理解问题出在物理层面而不是软件逻辑。
Anthropic在公告里承认,Claude对物理世界的了解来自文本和图像,空间和物理推理有限,需要专家监督。

华盛顿大学Baker和Pinglay实验室的博士生Song做了三个验证:远程监控仪表板、AI代理值守qPCR、机械臂和液体处理器协作搬板。
他之前尝试过传统自动化,花了几周评估平台、追着厂商要支持、写胶水代码,最后放弃。用MHS连接六台仪器不到一周,包括写驱动的时间。
实现远程监控后,qPCR实验的扩增曲线会被实时分析,到合适时机它会问研究者要不要停止。研究人员不用再整夜盯着仪器屏幕,凌晨4点换板的场景也消失了。

此外,生物实验室自动化的科技公司 Tetsuwan 也把MHS接入了自家的自动化生物实验室平台。摄像头检查移液过程,发现气泡就通知Claude,Claude通过Slack给出处理建议,然后用MHS操作离心机把气泡除掉。没有这套协调,流程遇到气泡只能卡住。
他们的测试还做了一个编译器优化实验,用AI闭环优化液体转移精度预测,在最可复现子集上比厂商规格高约17%。

边界与生态
Anthropic明确了边界。MHS目前不支持没有编程接口的设备。Claude的物理直觉仍有限,Genentech的气泡事件就是例证。QuEra团队提到,Claude对硬件的理解是程序化的,遇到真正的硬件故障不会排查。
它还会在自认为有风险的操作前停下来等人批准,导致实验有时整夜停滞。但用QuEra的话说,过度谨慎的代理比不够谨慎的好。
QuEra团队的观察更细致。Claude对硬件的理解是程序化的,遇到真正的硬件故障不会排查;它还会在自认为有风险的操作前停下来等人批准,导致实验有时整夜停滞。不过用QuEra的话说,过度谨慎的代理总比不够谨慎的好。
目前,硬件厂商的跟进速度超出预期。AWS将把MHS集成到Strands Robots库;Doosan Robotics在测试机械臂联动;Universal Robots计划加入支持;Tecan和QIAGEN分别在自己的液体处理平台和核酸纯化平台上做集成。
放到更大的坐标系里看,实验室自动化领域早有SiLA 2、工业领域早有OPC UA这样的老标准,但它们都不是为AI Agent原生设计的;另一边,Physical Intelligence、谷歌Gemini Robotics、英伟达GR00T走的是端到端机器人模型路线,试图教会AI“身体本身怎么动”。
MHS选了完全不同的路:不碰机器人的“小脑”,让大模型当“指挥官”,用标准驱动调度现成的硬件控制系统。前者难在数据和运动控制,后者难在生态——两条路线谁先跑通,还是未知数,但它们更可能是互补而非替代关系。
结语
社区的声音并不一致。有人惊叹,Anthropic发布标准的速度像JavaScript库发版。也不乏嘲讽:“连 Strawberry 里的 r 都数不清,现在就要操作工厂设备了?这我不买账。”

还有问得更具体:安全护栏在预览版里怎么工作?如果代理要求转动阀门,它会直接拒绝吗?开发者Rhiyddun则质疑流程本身:为什么不先发布RFC公开讨论,而是直接给出一个标准?

面对这些质问,Anthropic 目前能给出的对策主要是暂缓全面开源。把研究预览版的范围局限在核心合作方内,就是为了先在真实的设备泥沼里把安全边界捋清楚,测试申请入口设在 https://modelhardwarestandard.com/
声明:本文为 AI 前线编译,不代表平台观点,也不构成投资建议,未经许可禁止转载。


会议推荐
QCon 全球软件开发大会·2026(上海站)现已正式启动。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。

今日荐文
开源模型两个月内杀死比赛
DeepSeek 再度调价;英伟达AI服务器涨价超 15%;“AI红娘”承诺三年不结婚就退款,前 Kimi搜索负责人创业目标:拉高10%结婚率 | AI周报
美团反思“养虾”日耗上千万元、干扰真实经营,龙虾之父自曝:爆火后差点删掉整个项目
刚刚,DeepSeek上线多模态模型

