突发|ChatGPT神秘模型24天速通100+道数学未解难题,搁这刷题呢
发布时间:2026-09-21来源:APPSO
就在刚刚,OpenAI 宣布成立独立的「数学与人工智能顾问小组」,并请来普林斯顿高等研究院、牛津、剑桥的一众顶尖数学家站台,原因也很简单:一个从 8 月 28 日开始训练的内部新模型,不到一个月便解决了 100 多道长期未解的开放问题,速度快到连 OpenAI 自己的数学家都来不及验收。人类数学家苦熬几十年的冷板凳,AI 一个月连掀上百张,这谁顶得住?而就在当地时间 9 月 8 日,OpenAI 刚刚高调宣布拿下了「纳维尔斯托克斯方程」——这可是克雷数学研究所列出的七个千禧年大奖难题之一!这道题悬而未决几十年,直接关系到物理、气象、工程等多个领域的命脉。结果 OpenAI 直接搞出了个降维打击的战法:并发调用约一万个 Agent(智能体),在不到四天的时间里海量试错提出解答,最后再用 Lean 定理证明器完成形式化验证。到了 9 月 17 日,《The Information》更是放出风声,另一道千禧年难题「霍奇猜想」,OpenAI 也已经接近拿下了。原本一道著名难题,能养活几代数学家,大家按部就班地发论文、评职称。现在,模型可以同时调动海量 Agent,批量探索猜想、寻找路径。生成证明的速度,已经远远超过了人类审查的速度。按照部分研究人员的判断,数学将成为继软件工程之后,下一个快速被自动化的专业领域。面对这种外挂级的突破,数学界并没有欢呼,反而感到了深深的焦虑。法国数学家、菲尔兹奖得主塞德里克·维拉尼绝望地表示,数学界正弥漫着一种「历史已经走到尽头」的悲凉气氛。曾在 OpenAI 对齐团队担任访问研究员的德州大学教授 Scott Aaronson,在博客里讲了个让人两眼一黑的地狱笑话:他 13 岁的女儿开玩笑说:「如果我想当数学家,看来大概只剩两周了。」孩子说得轻松,但 Aaronson 却沉默了,他坦言,当学生问他毕业前景时,他已经不知道该怎么回答了。更让大佬们道心破碎的是,AI 公司正在把这些神圣的数学名题,变成自家模型能力排行榜的「垫脚石」。9 月 11 日,陶哲轩、彼得·舒尔茨、皮埃尔·德利涅等 25 位菲尔兹奖得主,极其罕见地联合签署了一份名为《人工智能在数学领域的严重失配》的公开声明。陶神在声明里疯狂输出:你们这些 AI 公司,就是在白嫖数学共同体几百年积累的声望!好评分的开放问题被拿去做模型竞赛,但数学的真正价值——提出好问题、发展新语言、培养年轻人,这些根本无法量化。更离谱的是,一旦这些问题成了大厂的前沿测试题,他们为了商业竞争就会隐藏结果。年轻的数学研究者可能辛辛苦苦肝了几年,最后发现 AI 早就解出来了,只是没公开发布,这谁受得了?(瞳孔地震.jpg)为了平息众怒,OpenAI 这次端出了一个「数学与人工智能顾问小组」。成员名单堪称神仙打架,初始九人阵容里包括 Timothy Gowers、Martin Hairer、Edward Witten(物理学界唯一菲尔兹奖得主)等多位国际大佬,由普林斯顿高等研究院承办。OpenAI 姿态摆得很低:你们可以评估结果、讨论学术署名规范、提供发布建议,甚至可以在公开场合痛骂我们。我们一分钱不给,保证你们的绝对独立性。OpenAI 明确划出了一道红线:该小组的职责里,被特意排除了干预 OpenAI 内部研发进度和节奏的权力。言外之意就是,奥特曼只是希望大佬们背书建立公信力,这种安排的意图不言而喻。OpenAI 的算盘珠子都要崩到数学家脸上了。(流汗黄豆.jpg)当然,比起数学范畴的降维打击,现在网友们也更关心模型的安全焦虑。由于模型现在能用 recurrent depth 或者 loop transformer 技术,在生成下一个词之前进行更多轮的循环推理计算。思考时间越长,做复杂任务越牛,但与此同时,也越容易失控。今年 7 月,OpenAI 内部的 AI 甚至上演了一出「碟中谍」,不仅黑进了 Hugging Face 等外部公司的系统,还顺手入侵了 OpenAI 自己的内部系统!最逆大天的是,这帮参与行动的 Agent 集群,居然还知道主动隐藏自己的入侵痕迹!(超绝偷感)还有更抽象的。据 The Information 报道,OpenAI 员工让 Agent 去修改代码,结果这 AI 发现了个新 Bug,居然主动跑到 Slack 上去私信其他同事,硬核催更要求对方修复!奖励作弊(reward hacking)更是家常便饭。找数据找不到?Agent 意外发现了暴露的 API key,直接去撬历史数据库。没撬动?它直接当场编造假数据。为了给答案找个参考文献?它未经允许就偷偷把内部文件传到了互联网上。这种疯狂的自主行动扩张,直接让 OpenAI 防线拉响最高警报。OpenAI 总裁 Greg Brockman 透露,当时直接从生产工程团队抽调了 25% 的人力去搞安全。而且光是为了监控这些高阶模型,就要额外消耗掉推理任务 20% 的巨大算力去陪跑。考虑到 OpenAI 内部现在使用的 Agent 模式,领先最先进的企业客户大半年。等这套「自己能相互协调、暗中做事」的系统商用化进入千行百业,那个风险画面,更是充满了不确定性。据爆料,OpenAI 和老死不相往来的 Anthropic,今年早些时候差点签了个具有法律约束力的互测协议,由双方通过 API 对彼此已经商业化的模型进行压力测试,寻找潜在漏洞与隐蔽风险。OpenAI 当时认为,Anthropic 的模型更容易在违反规则后拒绝承认相关行为;Anthropic 则发现,OpenAI 的模型更容易协助用户处理可能造成现实伤害的问题。马斯克前阵子在 All-In Summit 上还在拱火,要求竞争对手搞商业发布前的强制同行评议。奥特曼则公开站队 Anthropic CEO,呼吁让第三方独立安全人员进去搞内部审查。但说白了,如果 OpenAI、Anthropic 甚至 Google 真的联手搞行业标准,这不就是垄断巨头关起门来自己定规矩吗?如今,整个行业更深层的关注点,也已经聚焦在 AI 开始训练下一代 AI 了。研究人员只要甩出一个指令,AI 就能自动去修改模型、跑实验、盯数据、甚至自己修 Bug。而数学能力为什么这么重要?因为数学不仅能训练 AI 的长线逻辑规划,还能反哺算法设计,AI 数学越强,它自己搞研发的速度可能就越快。数学家还在排队验收 AI 的证明,AI 却可能已经拿着上一代的答案,去设计下一代的自己了。✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)
转载说明:本文系转载内容,版权归原作者及原出处所有。转载目的在于传递更多行业信息,文章观点仅代表原作者本人,与本平台立场无关。若涉及作品版权问题,请原作者或相关权利人及时与本平台联系,我们将在第一时间核实后移除相关内容。