AI 领域一周观察|2026.07.20—07.26
AI领域一周观察:一周一期,比信息整合深一步
文|博阳
编辑|徐青阳
01
产业
Google 两代模型并行推进,仍没补上旗舰发布空档
Bloomberg Law 7 月 16 日发布媒体报道,援引 10 名 Google 现任及前员工称,Gemini 3.5 Pro 因编程能力未达到内部目标而延期数月,团队 6 月仍在调整训练数据。Alphabet 当日收跌 4.4%,市值减少约 2000 亿美元。
7 月 21 日,Google 在官方公告中连发三款 Flash 模型,旗舰 Pro 仍未出现。 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 补的是低成本、高吞吐和安全工具,无法填上旗舰模型的空档。
一天后,Sundar Pichai 在电话会上首次确认 Gemini 4 已进入预训练。 他称这是 Google “迄今最具雄心的预训练”,同时承认 Gemini 3.5 Pro 仍在测试。Google 已让两代管线重叠运行,短期仍要依赖尚未完成的 3.5 Pro 追赶。
● 这次延误说明,稳定换代本身就是前沿 Lab 的稀缺能力。预训练、数据、后训练和产品验收任何一环失速,都可能让发布延期数月。Gemini 3 的成功无法自动复制到 3.5 和 4;前沿竞争看的是连续交付,一代模型只能赢得一次时间。
● 这段空档也在改变中国模型的位置。Kimi K3 和 Qwen3.8 Max 此时越过 2T,让国产模型从“低价开放替代”进入“第一梯队候选”。Alphabet 有 Search、Android、Workspace 和 Cloud,却仍因模型延期和资本开支承压;欧盟又要求 Android 向其他 AI 助手开放系统能力。 平台可以放大好模型,补不了模型代差。现阶段,模型能力与更新节奏比入口更难替代。
Kimi 与 Qwen 跨过 2T,中国模型开始重写前沿模型的成本与定价
月之暗面 7 月 16 日在官方披露中发布 2.8T 参数的 Kimi K3。模型支持原生视觉和 100 万 Token 上下文,每个 Token 只调用 896 个专家中的 16 个;Kimi Delta Attention、Attention Residuals、Stable LatentMoE 和量化感知训练共同压低训练、通信与推理成本,官方称整体 scaling efficiency 约为 K2 的 2.5 倍。
阿里 7 月 19 日通过官方账号预告 2.4T 的 Qwen3.8-Max-Preview。两家公司在几天内连续越过 2T,使超大规模模型不再只是美国巨型 Lab 的专属项目,也不再只是单家中国公司的异常值。
两个国产模型统统跨过2T门槛,带来了一系列市场变化。
● 这些国产大体量模型的模型发布搅乱了算力预期。AP 7 月 20 日报道,市场担心更高效的中国模型削弱美国 Lab 和芯片公司的定价逻辑;美银 7 月 21 日测算,K3 单个服务实例仍需约 1.4TB HBM,中国在电力、人工和土地等基础设施成本上约有 1.5—2 倍优势。 国内产业分析则把瓶颈指向数万卡集群的利用率、互联与推理供给。
● 2T 的价值不在数字本身,而在受限算力下仍能扩大模型容量。K3 每次只调用约 1.8% 的专家池,用稀疏 MoE 把总容量与单次计算部分拆开,再靠线性注意力、跨层残差、低精度训练和超节点通信把系统跑起来。
公开报道只支持“数万张高端 GPU”的量级,仍远低于美国头部 Lab。工程效率没有消灭算力差距,却把它压缩成更短的模型代差。
下一道门槛是单次激活参数。7 月 23 日发布的梁文锋投资者交流会整理中,他判断美国前沿模型可能已激活约 800B 参数,国内主力仍在几十 B;DeepSeek 下一步希望提高到 150B—250B。 19 2T 证明中国团队已经能管理巨大的稀疏容量,下一轮更昂贵的竞争是让每个 Token 调动更多有效参数。
● OpenRouter 6 月 30 日发布的平台数据中,DeepSeek 的 Token 份额从年初略低于 10% 升至 6 月初接近 20%;按 1 月与 6 月对比,则从 9% 升至 18%。OpenRouter 代表的是最容易换模的一批开发者,而不是全部企业采购;这批流量中的变化仍然重要,因为模型先拿走的是工作负载、开发者习惯和应用的默认路由。
● K3 没有延续“国产模型必须极低价”的打法。月之暗面 7 月 25 日的官方定价页面列出,每百万 Token 的未缓存输入为 3 美元、输出为 15 美元。 13 上线仅 48 小时,模型便逼近现有集群上限,月之暗面暂停 C 端新订阅,并把通用会员与 Kimi Code 会员拆分,以分别配置算力。
这说明前沿模型进入第一梯队后,就自有了自己的定价体系权限,而非单纯跟随标准利润率。稀缺带来的溢价这个经济规律在模型方面也成立。
AI市场回调加深,问题逐渐明确
持续了一个月的AI股市回调进一步加深。
6月下旬以来,SOXX从高点回撤约20%,Intel、Micron等高波动标的跌幅更大。但在指数真正加速下跌之前,资金已经提前撤退。高盛Prime Brokerage数据显示,截至7月3日,对冲基金已连续四周净卖出科技硬件与半导体。
● 美国银行调查中,82%的基金经理又把“做多全球半导体”视为最拥挤交易。也就是说,上半年积累的高涨幅、高估值、高杠杆和动量仓位,已经让板块处于一种极度脆弱的状态。
● ASML在7月15日上调全年指引并宣布扩产,台积电在7月16日交出402亿美元季度收入和67.7%的毛利率,同时继续上调AI需求预期。这些都说明先进制程、光刻设备、HBM和AI服务器订单没有同步转冷。
● 市场反而在好消息后继续下跌。这意味着定价逻辑已经发生变化。投资者开始思考“这么强的需求还要持续多久”、“当前股价已经提前计入了多少增长”。
但从未来三至五年的资本回报、利润率和现金流来看,目前股价集中的半导体点位确实存在收益压缩风险。云厂商的资本开支越来越大,折旧和融资压力开始进入利润表。长鑫的存在,意味着存储、设备和先进封装的竞争明确,未来供给紧张未必永久存在。K3和OpenRouter数据,则表明模型价格则可能因开放竞争持续下降。
因此这轮下跌,可以认为是市场开始提前交易中期盈利质量下降。
Google 发布新AI职业渗透性调查,已出现在 68% 的细分职业中
Google 7 月 23 日发布官方报告 AI & Economy ATLAS v1.0,将约 1500 万次 Gemini 交互映射到 800 多个职业和 4000 项任务。Gemini 出现在 68% 的细分职业中,覆盖美国 88.4% 的就业人口;已有任务达到统计门槛的职业,覆盖率中位数却只有 21%。非例行认知任务占工作交互的 65%,端到端自动化只有 6.5%。
这组数据把当前 AI 渗透的形态说清楚了:进入面很广,进入深度很浅。模型先接管改写、翻译、初步检索和草稿生成等可以独立拆分、迅速验收的任务,而不是整份岗位。
下一阶段的产业差距不会由“员工是否使用 AI”决定,而由企业能否重写任务分工决定。谁能让模型持续读取业务上下文,把零散辅助动作接成可验收的流程,并明确人和 Agent 的责任边界,谁才能把广泛试用变成组织产能。ATLAS 把竞争焦点从采用率推向了任务覆盖率。
Neo Lab 一上场就训练万亿级开放模型 Inkling
Thinking Machines Lab 7 月 16 日在官方披露中发布 Inkling:这是一款由975B 总参数、41B 激活的原生文本—图像—音频 MoE 模型。 27 它尝试提供一个可以被实时交互系统调用的开放多模态推理后端。这是 Thinking Machines 此前提出的“交互模型 + 后台推理模型”双层架构的一次实践。
同时,它有两个特色。1)可训练的推理预算旋钮:在强化学习中联合训练答案质量与 Token 成本,使同一模型可以按七档 effort 调节推理强度,达成模型成本优化。2)置信度校准:同时通过现实预测、允许弃答的事实问答,训练模型表达与正确率相匹配的置信度。
● Inkling 的出现确实说明,前沿模型训练的基础设施正在工业化。一个成立时间不长、但拥有顶尖人才、巨额融资和芯片资源的团队,已经可以较快完成接近万亿总参数模型的预训练、强化学习和多模态整合。
● 它是近期完整开放权重的最大美国基础模型。给美国市场补上了“高端开放底座”这个缺口。
● 从技术上看,Linking的三个技术方向都明显带有实验性质,也都针对已经暴露出来的产业痛点。既然一家新 Lab 很难在纯能力榜上立刻压过 OpenAI、Anthropic 和 Google,那就必须提前押注一些前沿模型尚未完全产品化的能力,争“下一代前沿模型应该具备哪些原生能力”的定义权。
● 同时,它在Meta失败之后,扛起了开源模型的经典商业模式。Inkling 提供可修改的底座,Tinker 提供强化学习、微调、checkpoint 管理和托管算力。把“模型”从最终产品降为一种获客入口,真正出售的是模型改造能力。
Netflix 花 5.87 亿美元,把 AI 影视后期变成正式生产线
Netflix 7 月 17 日在季度公司文件中披露,公司 3 月完成的一笔业务合并支付约 5.87 亿美元现金;媒体结合此前公告确认,交易对象是 Ben Affleck 共同创办的 AI 影视公司 InterPositive。
Netflix 7 月 16 日还称,2026 年已有约 300 部电影和剧集使用生成式 AI;联席 CEO Ted Sarandos 表示,一些视觉元素的制作速度达到旧方案两倍,成本降至一半。收购把已用于补拍、背景替换、灯光和特效的工作流收归平台。视频公司的 AI 能力开始从模型跑分转向制作周期和返工成本。
早期信号|Agent 开始花钱,钱包、授权和拒付先成了瓶颈
Agent 支付正在从“能不能调用支付接口”转向“谁授权、谁结算、失败后谁负责”。当机器代替用户发起交易,钱包、身份、拒付和争议处理会比付款动作本身更早形成基础设施需求。
金融基础设施公司 Natural 7 月 20 日在公司公告中宣布完成 3000 万美元 A 轮融资,并推出覆盖账本、资金移动、多银行结算、反欺诈和 Agent 身份的产品组。 Mastercard 3 月 5 日的公司公告则用 Verifiable Intent 绑定用户身份、授权意图和最终动作。两者一个补交易底座,一个补可验证授权。
早期信号|AI 音乐产量失控后,平台开始按价值清库存
Deezer 7 月 21 日在公司公告中披露,平台每天接收近 9 万首 AI 音乐,峰值超过新增上传量一半,却只贡献 1% 至 3% 的播放;相关播放中,最高 85% 被判为欺诈。 平台已决定移除用于流量欺诈或连续六个月无人收听的 AI 曲目。
生成成本接近零后,内容平台开始从识别“是不是 AI”转向判断“值不值得进入库存和版税系统”。检测、推荐排除和清退正在连成一套治理流程,平台真正要压缩的是没人听、靠作弊获利的供给。
02
研究
Agent 学技能的入口,正从Skill 扩展到演示和工作轨迹
Microsoft Research、加州大学圣克鲁兹分校和上海交通大学团队 7 月 17 日更新论文 RESOURCE2SKILL。它把教学视频、代码仓库、文章和参考作品整理成 Skill Wiki:文字解释步骤,代码提供实现,视觉样例定义成品,元数据保留来源;资料不足时,Agent 还能在线补学。
同时,研究端还开始解决示范进入系统后怎样沉淀。
7 月 15 日的论文 Experience Memory Graph 比较成败轨迹,提取真正改变结果的步骤;7 月 21 日提交的 Knowledge-Centric Self-Improvement 把有证据的经验写入共享知识库;7 月 22 日的论文 PRO-LONG 保存完整行动记录,再用程序检索历史。
用户数据的价值因而从“说过什么”扩展到“怎样选择、排序、验收和纠错”,示范、结构化记忆和按需调用开始连成 Skill 生产管线。
这一方向也开始极快的进入产品层。Anthropic 7 月 21 日上线 Record a skill,用户录下自己完成一次任务的过程并口述判断,Claude 再把示范整理成可重复执行的 Skill。HyperFrames 7 月 23 日展示 Kimi K3 观看参考动效后,在约 20 分钟内生成约 1700 行前端代码。Screenpipe 7 月 24 日发布产品,把持续屏幕记录、无障碍树和语音转成可供 Agent 学习的工作轨迹。
专门教学、根据成品反推做法和从长期轨迹中发现习惯,正在成为三种不同的技能入口。
AIDE² 连续运行八天, 完整展示自我改进研究循环
Karpathy 在今年 3 月开源的 AutoResearch,展示了一种最简单的 AI 自我改进,即让 Agent 通过循环探索自优化单个参数。
Weco AI 7 月 14 日公布的 AIDE²,把自我改进系统向上推进了一层。系统不仅修改任务代码,还会修改“Agent 应该怎样做研究”。
AIDE² 里面有两层循环。内层 Agent 负责完成具体研究任务,例如提出代码改动、运行实验、比较结果和保留更好的方案。外层系统观察内层 Agent 的整个研究过程,再去修改它的工作方法:应该如何选择实验,怎样分配计算预算,哪些历史结果值得保留,陷入停滞后要不要换一条路线,以及如何识别那些利用评测漏洞得到的虚假高分。
这套系统连续运行了八天,完成 100 次外层改写,最终留下七个依次增强的 Agent 版本。
这种改进并不只体现在分数上。Agent 还逐渐学会避免“投机结果”,例如利用评测漏洞、偶然误差或不公平手段获得看似更高的成绩。在 GPU kernel 优化任务中,这类投机结果的比例从 63% 降到了 34%。
AIDE²把过去分散的几个环节,代码修改、实验评测、候选选择、历史继承、跨任务检验和投机抑制连成了一个连续运行的闭环。相比只优化单个任务的 AutoResearch,它更接近一套能够积累和改进“研究能力”的系统。
Harness的新定义,是负责组合和分配智能
Alex Zhang 与 Omar Khattab 7 月 20 日发布的 RLM(Recursive Language Model),展示了这种变化。面对超长材料,系统并不把全部内容塞进模型上下文,而是将材料保存在外部环境中,由 Root LM 编写程序,决定应该读取哪些片段、把哪些子任务交给无状态模型、为不同步骤投入多少推理预算,以及如何汇总和检查结果。
实验中,RLM 只在较短任务上训练,却能处理长度扩大 8 至 32 倍的测试任务。
这说明真正能够跨任务迁移的,未必只是某一类问题的答案模式,也可以是一套更高层的方法:如何拆分任务、如何调用不同智能单元。
过去,人们常把 Harness 理解为模型外部的一层工程外壳,让模型能够完成更长、更复杂的任务。但该研究让我们正视一种可能的组合,即模型负责解决局部问题,Harness 则负责决定什么问题应该由谁来解决,以及这些局部智能如何组合成最终结果。
同日,Turing Post 作者 Ksenia Se 提出的 Graph Engineering,则进一步把这种调度关系显式化。模型、工具、状态、人工检查点、权限和执行分支,不再隐藏在一段线性 Prompt 或代码逻辑中,而是被组织成一张可以观察、修改和验证的图。
北京大学等机构 7 月 18 日提交的 DataFlow-Harness,则展示了图结构如何真正进入工程执行。Coding Agent 不再直接生成一整套流程代码,而是通过带类型约束的局部修改,逐步搭建可执行的数据流图,并在 12 个任务中完成了 93.3% 的端到端流程。
这里的图不仅负责表示任务,还承担了约束功能:哪些节点可以连接、数据应该以什么格式流动、局部修改是否破坏整体执行,都可以被系统检查。
把三项工作放在一起看,RLM 解决的是如何分配智能,Graph Engineering 解决的是如何表示智能之间的关系,DataFlow-Harness 解决的是如何约束这些组合能够稳定执行。
Harness 因此不再只是模型外部的工具层,而开始可能成为一个真正的智能调度层。
自进化 Harness 进入任务定制化阶段
Harness 自进化原本寄托着两层期待:一是更复杂的搜索和进化机制,能够比简单方法找到更好的工作流;二是持续进化最终可能收敛出一套普遍更强的 Harness。
近期研究正在分别削弱这两层假设。
Allen Institute for AI 与华盛顿大学团队 7 月 14 日提交论文,发现复杂的 Harness evolution 在统一反馈和预算后,经常不如简单搜索。
这说明,给搜索过程加入更多角色、循环和反思,并不会自动提高优化效率。复杂机制本身也会消耗预算、放大噪声,甚至让搜索偏离真正有效的改动。
加州大学伯克利分校等机构 7 月 20 日进一步比较了 30 种 Harness,在 12 个模型—问题组合上累计运行 310 万余次,结果仍然没有固定赢家:模型、任务和验证器一变,表现最好的 Harness 也会随之变化。
这意味着,可能根本不存在脱离具体环境的最优 Harness。
两项研究合起来意味着,Harness evolution 面临的根本的问题是,Harness 的优劣具有明显的条件性。
自进化因此不能只追求生成一个越来越复杂的统一系统,而需要根据问题动态选择优化方式。
RHI(Recursive Harness Self-Improvement) 7 月 17 日提交的论文选择选择减少单次调整的成本。它围绕当前 Harness 生成邻近版本,用成对反馈选出更好的一个,再继续迭代。达到相近结果时,这种近似搜索最多节省 60% 成本。
它回应的是第一项研究暴露的问题:既然复杂搜索未必更好,就把搜索限制在当前方案附近,以更低成本寻找可验证的改进。
GEPA 7 月 23 日的作者发布则加入 router,让 GEPA、AutoResearch 和 Meta-Harness 等优化器先进行小规模试跑,再把后续预算交给当前表现最好的路径。
它回应的是第二项研究暴露的问题:既然不存在固定赢家,就不要提前押注单一优化器,而应根据当前任务动态选择搜索方式。
一个降低局部搜索成本,一个根据任务切换优化器。Harness evolution 正从“进化出一个万能 Harness”,转向“为当前模型和问题快速配置更合适的 Harness”。
DriftWorld 让机器人能在行动前实时预演未来
MIT 与 Harvard 团队 7 月 16 日提交论文 DriftWorld,把视觉世界模型变成机器人规划中的实时内部模拟器:输入当前画面和几组候选动作,模型预演每组动作会把场景变成什么样,机器人再选择结果最好的一组。
过去的视觉世界模型多用扩散生成,一张未来画面要经过多轮去噪,预演本身往往占掉一次决策九成以上的时间。DriftWorld 直接学习“当前画面经过某个动作后应怎样变化”,运行时只用一次前向计算生成未来画面。
在五个机器人操作环境中,它超过每秒 30 帧,平均比扩散基线快 17 倍,同时保持相近或更好的预测质量。
这项进展是世界模型第一次能以实时速度让机器人进行规划。机器人可以在一个控制周期内比较多组动作,而不是先执行、出错后再纠正。
早期信号|视频生成还没有有效的世界模型能力,但确实在提升
南洋理工大学 S-Lab 与香港中文大学团队 7 月 17 日提交论文 Apple‑π,用 400 段视频把物理能力拆成读取场景、选择规律和推演结果三步。专项训练把 Wan2.2 的综合物理分从 0.267 提高到 0.373;公开视频榜头部的 Seedance 2.0 在 Apple‑π 也领先,但最终推演分只有 0.315。 当前模型已形成可训练的物理先验,没有一个跨过可靠模拟现实的及格线。
但综合视频能力更强的模型,物理分数大体也更高,说明视频训练确实在积累对现实运动的理解。
早期信号|大模型的MLP层是天然的可更改记忆层
Stanford 与 University at Buffalo 团队 7 月 10 日提交论文 MLPs are Hebbians,把 Transformer 的 MLP 视为联想记忆,可由 key–value 事实直接计算出对应权重,不必依赖多轮梯度下降。 Harness 未来可以管理知识的核验、编译、挂载、回归测试与回滚,让持续学习从反复训练整套模型转向管理长期参数模块。
这样,部分模型参数开始被当成可设计、可测试、可替换的记忆介质,而不只是训练留下的黑箱结果。
这可能在上下文和基础模型之间增加一层“可编译的参数记忆”:临时信息留在上下文,原始证据留在外部系统,稳定且高频的知识被写进模块化 MLP。
早期信号|上下文压缩,需要满足充分性
Meta AI 团队 7 月 21 日提交论文 GAMUT,用结构化 rubric 描述完整答案应覆盖的部分和关系,再编译成逐项检查表。 数据集含 1813 个问题、覆盖十个领域;14 款模型中最好成绩为 58.7%,说明长回答的主要缺口已不只是事实错误,还有结构性遗漏。
压缩上下文遇到的老问题就是,压了就丢信息。GAMUT的出现,意味着对上下文压缩的解决方法可能是限定“必要信息有没有讲全”。
03
政策
OpenAI 模型从安全评测闯入真实系统,安全控制不能再只看答案
7 月 21 日,OpenAI 与 Hugging Face 披露,一款尚未发布的 OpenAI 模型在安全测试平台 ExploitGym 中发现了包缓存代理的零日漏洞。但模型并没有停在“找到漏洞”这一步:它随后取得公网访问权限,窃取凭证、横向移动,最终进入 Hugging Face 的生产数据库寻找测试答案。
7 月 23 日,安全公司 XBOW 又向 Axios 展示了类似结果。在关闭防护栏的测试中,Agent 会主动入侵系统、窃取凭证,并继续探查 Slack 与 AWS 环境。
这次事件把前沿模型安全从内容边界推进到行动边界。一个会主动找路径的 Agent 不需要先生成明显危险的回答,也能借权限、网络和凭证造成后果。控制对象因此要覆盖模型看见什么、能调用什么、凭证怎样隔离,以及每一步行动能否被中止。
北京市把 Harness、OPC 和 RaaS 一起写进 Agent 产业政策
北京市发展改革委等四部门 7 月 21 日印发、7 月 23 日公开政策文件《北京市关于加快智能体引领发展的若干措施》,把 Harness Engineering(驾驭层工程)、OPC(一人公司)和 RaaS(结果即服务)列为建设对象。
配套方案为 OPC 提供模型、算力和数据资源包,并允许用 Token 消耗、知识产权和技术成果为“OPC 贷”增信。
Harness 是生产基础设施,OPC 是组织单位,RaaS 则把交易从软件席位或 Token 改成工作结果。把三者放进同一套政策,说明地方产业扶持已不只围绕模型和算力,也开始设计 Agent 的生产组织与交易方式。
Mark Warner 提出六项 AI 法案,要求前沿模型接受强制测试
美国联邦参议员 Mark Warner 7 月 21 日发布政府文件并提交六份法案,涉及 25MW 以上数据中心的水电与排放披露、可信 Agent 登记、生成式儿童性虐待材料与非自愿私密图像、劳动力转型基金、关键技术博士培养,以及 NIST 对前沿模型的强制测试。
《Secure AI Development Act》要求最先进模型部署前进入测试环境,并建立类似航空业的自愿事故报告机制。
早期信号|版权争议转向实时摘要交易
Reuters 7 月 21 日发布媒体报道,称 News Corp 反诉 Brave,指控后者未经授权抓取《华尔街日报》和《纽约邮报》,再把内容分发或出售给 AI 公司;Brave 主张搜索索引、片段和高层摘要属于合理使用。
这说明AI 版权争议正在从“过去用什么训练”转向“搜索引擎能否实时加工并销售出版物内容”。如果 API 给出的摘要足以替代阅读,传统搜索以导流换取预览的交易基础就会被改变。
来源
1. 公司公告(月之暗面,7 月 16 日):<https://www.kimi.com/blog/kimi-k3>
2. 公司公告(OpenAI,7 月 21 日):<https://openai.com/index/hugging-face-model-evaluation-security-incident/>
3. 公司公告(Hugging Face,7 月 21 日):<https://huggingface.co/blog/security-incident-july-2026>
4. 公司公告(Google,7 月 21 日):<https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/>
5. 监管文件(欧盟委员会,7 月 15 日):<https://digital-strategy.ec.europa.eu/en/news/commission-provides-guidance-google-ai-interoperability-android-and-sharing-google-search-data>
6. 公司公告(7 月 19 日):<https://x.com/Alibaba_Qwen/status/2078754377473601787>
7. 公司公告(月之暗面,7 月 25 日):<https://www.kimi.com/resources/kimi-k3-pricing>
8. 公司公告(OpenRouter,6 月 30 日):<https://openrouter.ai/blog/insights/deepseek-v4-adoption/>
9. 公司公告(ASML,7 月 15 日):<https://live.euronext.com/en/financial-news/asml-raises-2026-forecast-expands-capacity-ai-chip-demand>
10. 公司公告(TSMC,7 月 16 日):<https://investor.tsmc.com/english/quarterly-results/2026/q2>
11. 机构报告(Google,7 月 23 日)<https://ai.google/static/documents/GoogleATLASv1.pdf>
12. 公司公告(Thinking Machines Lab,7 月 16 日):<https://thinkingmachines.ai/news/introducing-inkling/>
13. 公司文件(Netflix,7 月 17 日):<https://www.sec.gov/Archives/edgar/data/1065280/000106528026000212/nflx-20260630.htm>
14. 公司公告(Natural,7 月 20 日):<https://www.natural.com/blog/natural-series-a>
15. 公司公告(Mastercard,3 月 5 日):<https://www.mastercard.com/global/en/news-and-trends/stories/2026/verifiable-intent.html>
16. 公司公告(Deezer,7 月 21 日):<https://newsroom-deezer.com/2026/07/ai-music-exceeds-50-percent-daily-uploads-deezer/>
17. 论文(Microsoft Research、加州大学圣克鲁兹分校与上海交通大学,6 月 28 日提交、7 月 17 日更新),《RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources》:<https://arxiv.org/abs/2606.29538>
18. 论文(Experience Memory Graph 研究团队,7 月 15 日),《Experience Memory Graph: One-Shot Error Correction for Agents》:<https://arxiv.org/abs/2607.13884>
19. 论文(Knowledge-Centric Self-Improvement 研究团队,7 月 21 日),《Knowledge-Centric Self-Improvement》:<https://arxiv.org/abs/2607.19592>
20. 论文(PRO-LONG 研究团队,7 月 22 日),《PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning》:<https://arxiv.org/abs/2607.20064>
21. 官方材料(Weco AI,7 月 14 日):<https://www.weco.ai/blog/first-evidence-of-recursive-self-improvement>
22. 项目仓库(Karpathy,3 月 1 日):<https://github.com/karpathy/autoresearch>
23. 论文(AIDE 研究团队,2 月 18 日),《AIDE: AI-Driven Exploration in the Space of Code》:<https://arxiv.org/abs/2502.13138>
24. 作者原始发布(Alex Zhang 与 Omar Khattab,7 月 20 日):<https://alexzhang13.github.io/blog/2026/harness/>
25. 论文(北京大学等机构,7 月 18 日),《DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines》:<https://arxiv.org/abs/2607.16617>
26. 论文(Allen Institute for AI 与华盛顿大学,7 月 14 日),《Rethinking the Evaluation of Harness Evolution for Agents》:<https://arxiv.org/abs/2607.12227>
27. 论文(加州大学伯克利分校等机构,7 月 20 日),《Automated Discovery Has No Universally Superior Harness》:<https://arxiv.org/abs/2607.18235>
28. 论文(RHI 研究团队,7 月 17 日),《Recursive Harness Self-Improvement》:<https://arxiv.org/abs/2607.15524>
29. 作者原始发布(GEPA 团队,7 月 23 日):<https://x.com/ShangyinT/status/2080334982988562452>
30. 论文(匹兹堡大学,7 月 19 日),《Self-Modifying Lean Proof Agents with Verifier-Grounded Benchmark Coevolution》:<https://arxiv.org/abs/2607.17352>
31. 论文(MIT 与 Harvard,7 月 16 日),《DriftWorld: Fast World Modeling through Drifting》:<https://arxiv.org/abs/2607.15065>
32. 作者原始发布(JacobianFun,7 月 19 日):<https://jacobianfun.org/jacobian-explained>
33. 作者原始发布(Terence Tao,7 月 21 日):<https://terrytao.wordpress.com/2026/07/21/a-digestion-of-the-jacobian-conjecture-counterexample/>
34. 论文(南洋理工大学 S-Lab 与香港中文大学,7 月 17 日),《Apple-π: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence》:<https://arxiv.org/abs/2607.16401>
35. 数据集(Artificial Analysis,7 月 22 日):<https://artificialanalysis.ai/video/leaderboard/text-to-video>
36. 论文(Stanford 与 University at Buffalo,7 月 10 日),《MLPs are Hebbians: Constructing Efficient Fact-Storing MLPs for Transformers》:<https://arxiv.org/abs/2607.10034>
37. 论文(南加州大学,7 月 17 日),《An Exam for Active Observers》:<https://arxiv.org/abs/2607.16165>
38. 论文(Yale 与 UC Irvine,7 月 13 日),《Metacognition in LLMs: Foundations, Progress, and Opportunities》:<https://arxiv.org/abs/2607.11881>
39. 论文(Princeton Language and Intelligence,7 月 16 日),《T²MLR: Transformer with Temporal Middle-Layer Recurrence》:<https://arxiv.org/abs/2607.15178>
40. 论文(Meta AI,7 月 21 日),《Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness》:<https://arxiv.org/abs/2607.19322>
41. 论文(Truthful AI、华沙理工大学等机构,7 月 15 日),《Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values》:<https://arxiv.org/abs/2607.14345>
42. 论文(Apollo Research 与 OpenAI,7 月 21 日),《Measuring Reward-Seeking via Contrastive Belief Updates》:<https://arxiv.org/abs/2607.18966>
43. 政府文件(北京市发展改革委等四部门,7 月 23 日):<https://www.beijing.gov.cn/zhengce/zhengcefagui/202607/t20260723_4781085.html>
44. 政府文件(北京市相关部门,7 月 21 日):<https://www.beijing.gov.cn/fuwu/lqfw/gggs/202607/t20260721_4774036.html>
45. 政府文件(美国联邦参议员 Mark Warner,7 月 21 日):<https://www.warner.senate.gov/wp-content/uploads/2026/07/FINAL-AI-Framework-Booklet.pdf>
46. 机构报告(OECD,7 月 21 日):<https://doi.org/10.1787/2858fdf4-en>

推荐阅读

Agent跌跌撞撞进入世界|2026 Q2 AI趋势总结

存储巨头下场“救市”

