OpenAI王炸!GPT-5.6 Sol自主做量子实验,研究人员只插手了4次


这几天,一份联合报告在科技圈和物理学界被反复提及。
OpenAI与麻省理工学院(MIT)量子工程系统组(EQuS)共同发布了一项案例研究报告,名为《案例研究:超导量子比特的智能体校准》(Case Study:Agentic Calibration of Superconducting Qubits)。报告指出,基于GPT-5.6 Sol大模型和Codex驱动的AI智能体,实现了端到端自主运行超导量子比特的相关计算实验。
也就是说,AI现在不仅能写代码,也可以开始自主做物理实验了。
在这个过程中,研究人员把GPT-5.6 Sol通过Codex接入实验室软件,把一块此前从未校准过的6量子比特超导芯片交给AI智能体操作。它可以选择参数、调用测量程序、读取图像和原始数据、判断结果是否合格,并据此决定继续优化还是进入下一项测量。
从结果来看,AI智能体成功找到了6个读出谐振腔。在4个固定频率量子比特的40项目标测量中,研究人员仅对其中4项进行干预。此后,它还监控了一段持续12小时的自动循环,完成约200次测量,并对失败点作进一步检查。
显然,这不是AI第一次出现在量子实验室里。比如Google DeepMind的AlphaQubit、NVIDIA的QCalEval,北京量子信息科学研究院联合其他机构发布的Vibe Calibration等,在量子硬件侧,AI正在从”写代码、看文献”进化到”直接上手做实验”。

量子比特校准为什么需要AI
超导量子比特被称为“人造原子”,其离散能级用于编码量子信息。但与传统半导体器件不同,量子比特在环境中非常脆弱。极微弱的电磁干扰、稀释制冷机内毫开尔文级别的温度波动,都会导致量子比特退相干,使存储的量子信息迅速丢失。
而且,量子比特的物理特性不是固定不变的。材料缺陷、环境波动会导致共振频率漂移,昨天校准好的参数,今天可能就失效了。MIT的EQuS团队每天面对的就是这样一个动态系统。
实验流程本身也高度相互依赖。研究人员必须先找到量子比特的共振频率,才能校准用于控制和读取的微波脉冲;完成脉冲校准后,才能测量量子比特的相干时间。整个过程需要数百乃至数千次初步测量,每一步的结果都定义着下一步的条件。

图:一个封装的量子比特芯片(左)置于一个开放式稀释冰箱内(右)
来源:EQuS
根据OpenAI的博客文章,即使是对EQuS团队的标准芯片进行完整表征,一个有经验的研究人员也需要花费数天时间。而对于更复杂的多比特实验,准备周期可能长达数月。
这几千次的初步测试和不断因为错误迭代而重来的微操,把大量顶尖量子物理学家的精力耗在日复一日的底层调优上。因此,量子比特校准成为AI智能体的理想应用场景。

实验室里发生了什么
MIT研究生Beatriz Yankelevich在这项研究起着重要作用。她将GPT-5.6 Sol通过Codex连接到实验室的协调软件,使AI智能体能够直接与量子芯片进行交互。
实验对象是一块从未被测量过的六量子比特超导芯片,其中四个是固定频率量子比特,两个是可调频率量子比特。芯片的参数完全未知,AI必须根据设计目标自主探索真实的物理参数。
研究人员为Codex提供了“测量专项技能”,这些技能包含如何执行和评估每种实验的详细说明。根据报告,这些技能包括:模板代码和执行分析流程、必须完成的前置校准、选择测量参数的技巧、常见的物理失败原因、成功与失败测量的特征。
随后,人类放开了双手。GPT-5.6 Sol在没有人类实时微操的情况下执行了一整套物理学闭环操作:
-自主推断参数:根据芯片的设计目标,自行规划首轮测量的微波脉冲频率、功率和宽度;
-底层硬件调度:直接调用控制软件,操纵硬件向稀释制冷机深处的芯片发射微波脉冲序列;
-数据处理与降噪:接收返回的微弱量子态反射信号,对其进行数字化清洗、拟合与傅里叶变换;
-自适应迭代决策:如果信号完美,自动提取出量子比特的共振频率并存入数据库,作为下一步测量的基准;如果数据异常,当场调整测量边界,开启新一轮试错调优。

图:自校准运行中的GPT-5.6 Sol思维链
来源:EQuS
从识别量子比特跃迁频率、校准用于控制和读取的微波脉冲,到最终测定量子信息能够留存多久的相干时间,整套标准物理学测量流程,AI全程自主跑通。



图:一组由GPT-5.6Sol自主完成的单个量子比特校准测量
来源:EQuS
不过,在官方报告里,也展示了当前实验的技术边界。
比如在实验信号清晰且量子比特行为符合预期时,AI智能体就会表现的非常可靠。在40项针对固定频率量子比特的目标测量中,AI自主完成了约90%的工作,人类研究员仅干预了4次。
但是,当实验信号微弱、噪声较大或者出现物理上模糊的结果时,AI在处理过程中就会遇到较多困难。在这些情况下,AI需要花费更多的时间找到合适的测量参数,有时候还需要有经验的研究人员来指导。
结果表明,现有的AI智能体能够处理明确定义的实验流程,但解读模糊的物理结果仍是一大挑战。

AI早已进入量子实验室
当然,这也并不是AI第一次进入量子领域。据不完全统计,2024年11月,Google DeepMind和Google Quantum AI联合发布AlphaQubit,用Transformer神经网络做量子纠错解码器,成果发表在《Nature》上。这是AI第一次在纠错环节取得超过经典优化解码器的准确率。
2025年10月,牛津大学等科研团队在Patterns期刊发表框架论文,用agent-based AI框架编排量子实验室实验流程,覆盖从任务规划到数据解释的完整链路。他们在超导平台上无人工干预跑了约3小时两比特门校准,还制备并表征了纠缠态。
2026年3月,芝加哥大学Cleland课题组发布HAL框架,基于LLM自主完成谐振腔表征实验,并成功复现了一篇已发表论文中的QND表征实验,配套代码已开源。
2026年4月,NVIDIA联合多家机构单位发布QCalEval,这是第一个针对量子校准图的视觉语言模型基准。其涵盖243个样本、87种场景类型、22个实验家族,能够跨越超导量子比特和中性原子平台。
2026年6月,北京量子信息科学研究院、中国科学院物理研究所等组成的研究团队发布Vibe Calibration,用Claude Code配合微调的Qwen模型,把专家经验蒸馏成结构化技能,类似于决策树形式,包括测量命令、验收标准、审计记录等。4.7小时自主校准112比特处理器上的108个量子比特,较人工校准速度快了4.5倍,而且在16比特子集上校准结果与专家保持一致。
2026年7月,Google在《Nature》期刊上发表的最新成果,把强化学习与量子纠错结合,使自主智能体通过实时监控错误检测事件,动态调整数千个控制参数,在运算过程中持续对抗硬件漂移,无需中断计算。这套方案在Willow处理器上将逻辑错误率额外降低20%,达到每千次纠错循环不足一次的历史最低水平。
2026年8月,Nature新闻版报道法国中性原子公司Pasqal研究团队开发的一套人工智能工具。这套工具能够根据英文自然语言指令生成量子计算程序,并进一步调用量子计算机执行实验。

图:从科学文献到硬件实验的AI工作流
来源:Pasqal
在本次MIT的实验中,AI智能体能够在夜间或研究人员处理其他任务时持续进行测量。Yankelevich表示:“我可以让多个智能体同时处理不同的问题,而我大部分时间都花在更高级的工作上,比如解读结果、设计实验、为智能体规划下一步。”
对产业界来说,这样的工作模式最直接的好处就是省人。物理学家在重复测量上耗费大量时间的旧常态,正在被智能体值守+人类决策的新分工替代。
不过我们需要注意的是,当下工具的潜力巨大,但AI智能体暂时还不能称得上是一个“完全自主的科学家”,更多的还是人和AI协同发展。
[1]https://openai.com/index/codex-quantum-computing-experiments/
[2]https://cdn.openai.com/pdf/case-study-agentic-calibration-of-superconducting-qubits.pdf
[3]https://coderliang.com/posts/3bd3d2ae-9a68-4829-b8e7-7a3dd4c149e7
[4]https://www.nature.com/articles/d41586-026-02495-4
[5]https://arxiv.org/abs/2606.22376
[6]https://blog.google/technology/google-deepmind/alphaqubit-
quantum-error-correction/
[7]https://www.sciencedirect.com/science/article/pii/S266638992500220X





