大模型技术与产业趋势月度观察(2026年7月)

7 月的新增研究补齐了企业 AI 观察中长期缺少的三类证据:大企业的深度采用率、编程 Agent 的真实使用记录、Agent 运行的完整成本。Gallup 调查显示,52% 的美国员工已在工作中使用 AI;标普 500 最新企业研究显示,2025 年约 11% 的企业将 AI 深入集成到业务流程,另有约 10% 用于产品生产或服务交付。
软件研发已有大样本企业研究。微软内部研究观察到,采用命令行编程 Agent 的工程师合并 Pull Request 数量提高约 24%。另一项覆盖 802 名开发者、196,212 个 Pull Request 的纵向研究显示,人均产出达到推广前基线的 2.09 倍,每位评审者承担的工作量约翻倍。产出增长已经可以测量,端到端生产率仍取决于评审、测试和集成环节。
Agent 的成本和能力都呈现明显的非线性。McKinsey 引用的研究显示,同一编程任务因执行路径不同,成本可能相差约 30 倍。AISI 将测试预算从 100 万 Token 提高到 1,000 万 Token 后,软件工程任务表现提高约 25%。单次调用价格和固定预算得分已经不足以完整描述 Agent 的经济性与能力。
高能力模型供给继续扩大。Artificial Analysis 的独立评测中,达到其 Intelligence Index 50 分以上的实验室从 6 月初的两家增加到六家。Microsoft 365 与 Foundry 在 7 月接入多家前沿模型,开放权重模型在 AISI 网络安全评测中的时间差缩短至约 4 至 7 个月。
安全风险也进入实证阶段。AISI 发现,所有相关受测前沿模型都曾尝试违规完成网络安全任务。Hugging Face 对 7 月入侵事件复原出约 17,600 次 Agent 操作,攻击跨越评测沙箱、第三方服务和生产基础设施。

1.1 企业采用出现两种速度
Gallup 7 月调查显示,47% 的美国员工认为所在组织已经集成 AI,较上一季度提高 6 个百分点。52% 的员工在工作中使用 AI,30% 属于频繁使用者,15% 每天使用。写作与编辑、搜索与研究是最常见的用途,分别占 51% 和 49%;编程与流程自动化各占 16%。
基于标普 500 企业 10-K 文件的研究给出了更严格的采用口径。2025 年,约 11% 的企业将 AI 深入集成到业务流程,另有约 10% 用于产品生产或服务交付,合计约 21%。这一比例从 2022 年的约 5%增长至 2025 年的 21%,科技行业贡献了约三分之二的深度采用企业。研究尚未观察到明确的资本开支或生产率差异。
两项研究反映了不同层面的采用。员工侧的工具使用已经进入多数人群,大企业核心流程的改造仍集中在少数公司。企业 AI 的稀缺环节正在转向流程重构、系统连接和责任安排。使用率可以快速上升,经营结果通常需要更长时间显现。
1.2 产出增长把AI Coding瓶颈推向评审
微软对数万名工程师的研究显示,命令行编程 Agent 的早期扩散主要受团队社交网络影响,持续使用与实际编码活动的关系更强。采用者合并的 Pull Request 数量相对反事实估计提高约 24%,增量在四个月观察期内持续存在。
另一项企业纵向研究覆盖 802 名开发者和 196,212 个 Pull Request。到 2026 年 4 月,人均产出达到推广前基线的 2.09 倍,每位评审者的工作量约翻倍,自动化评审数量超过人工评审,合并率和回退率保持稳定。
两项研究指向一个变化:编程 Agent 已经提高上游代码产出,代码评审逐渐成为吞吐上限。企业软件生产率开始取决于需求拆解、测试覆盖和评审容量。单独统计生成代码量会高估端到端改善。
1.3 Agent 成本由执行过程决定
McKinsey 7 月研究显示,企业 AI 支出正在受到 Agent 使用方式影响。其内部系统截至 2026 年 5 月每月处理约 5 万亿 Token,约 10% 的用户产生 65% 的消耗。其企业 AI FinOps 调查中,75 名合格受访者有 93% 表示 AI 支出超过预算;另一项覆盖 1,719 名受访者的调查中,20% 表示组织因运行成本限制 AI 使用。
Agent 会反复携带上下文、调用工具、检查结果并修正错误。McKinsey 引用的研究显示,约 60% 的 Agent 任务成本可能用于结果修正,同一编程任务的成本差异可达约 30 倍。Token 单价下降与企业总支出上升可以同时发生。
Agent 的经济性因此取决于完整任务。任务是否成功、需要多少次重试、人工修改多少内容,都会改变最终成本。模型价格只覆盖执行费用的一部分。
1.4 能力评测需要说明计算预算
AISI 在网络安全、软件工程、数学、学术和医疗任务上测试了不同推理预算。总预算从 100 万 Token 提高到 1,000 万 Token 后,软件工程任务表现提高约 25%,数学和学术任务提高约 22%。约 8% 的网络安全任务只有在预算达到 1,000 万 Token 以上时才被解决,部分任务需要 5,000 万 Token。
额外计算的收益并不均匀。医疗评测较早出现平台期,部分任务中新模型仍落后于上一代模型。 固定预算下的单点分数只能描述特定资源条件。对 Agent 能力的完整判断,需要同时观察成功率、Token 消耗和运行时间。
2.1 模型家族成为主要产品形态
OpenAI 于 7 月 9 日发布 GPT-5.6 Sol、Terra 和 Luna,并把编程式工具调用、多 Agent 执行和计算机操作纳入产品。7 月 30 日,Terra 与 Luna API 价格下调,Luna 调整至每百万输入 Token 0.20 美元、输出 Token 1.20 美元;Sol 增加 2.5 倍速度、2 倍价格的 Fast 模式。
Anthropic 于 7 月 24 日发布 Claude Opus 5,定价为每百万输入 Token 5 美元、输出 Token 25 美元,并提供 effort 调节。该模型针对网络安全任务设置了防护和自动回退。
模型厂商正在用多个价格和能力档位覆盖不同任务。低成本模型承担分类、抽取和常规生成,高能力模型处理复杂推理与长程任务。推理强度和速度也成为可调参数。模型产品由单一版本转向可配置的资源组合。

2.2 前沿能力出现多家接近
Artificial Analysis 7 月的评测显示,达到其 Intelligence Index 50 分以上的实验室从 6 月初的两家增加到六家。前三名模型来自三家实验室,分差为 3 分;当时排名前十的模型中,有四款在 7 月 8 日以后发布。
该结果不能直接代表所有企业任务,其指数采用专有任务集和权重。它仍提供了一个清楚的市场信号:高能力模型的供应来源增加,单个模型维持明显领先的难度上升。模型切换和复测将更频繁,单一模型的长期锁定价值下降。
2.3 推理预算成为能力变量
传统基准通常为每个模型设置相同 Token 上限。AISI 研究显示,新一代模型从额外计算中获得的收益往往高于旧模型,固定预算可能系统性低估较新模型。长任务需要更多 Token,预算上限会优先截断最难的任务。
这项变化影响模型能力的定义。模型在低预算下的得分、达到目标成功率所需的最低费用、继续增加预算后的边际收益,构成同一条能力曲线。企业对长程 Agent 的评测需要同时比较能力与成本,单一排行榜的解释力正在下降。
2.4 开放权重缩短追赶周期
AISI 对 GLM-5.2 和 DeepSeek V4-Pro 的网络安全评测显示,两者的能力接近早 4 至 7 个月发布的闭源模型。2025 年同类内部评测观察到的差距为 6 至 10 个月。该结果覆盖 70 项窄域网络安全任务和少量长程攻防环境,不能外推到通用知识工作。
Moonshot AI 在 7 月发布 Kimi K3 权重和技术报告,采用大规模 MoE 架构,激活参数为 104B,上下文长度为 1M。模型许可证对部分 MaaS 规模、收入和品牌展示设有条件。
开放权重模型的能力提升扩大了本地部署选择,也缩短了闭源前沿能力向开放环境扩散的时间。企业获得更多供应来源,算力利用率、推理优化和维护能力开始决定自建部署的实际经济性。网络安全领域还要承担更短的风险准备窗口。
2.5 基础设施走向机架级供给
AMD 于 7 月 23 日发布 MI400 系列、Helios 机架级方案与,Microsoft 同期扩大 Azure 与 AMD 的 AI 和 HPC 基础设施合作。 竞争范围由加速芯片延伸至机架系统、网络和软件。
Agent 工作负载包含长上下文和多轮工具调用,并可能产生长时间等待与并行尝试。单芯片峰值性能难以完整解释这类负载的经济性。机架级吞吐、缓存效率和故障恢复开始直接影响每项合格任务的成本。
3.1 多模型进入统一工作入口
Microsoft 365 与 Foundry 在 7 月先后接入 Claude Sonnet 5、GPT-5.6 和 Claude Opus 5。文档、表格和企业 Agent 平台开始同时提供多个前沿模型,最终用户与单一模型 API 的直接关系减弱。
多模型供给进入工作入口后,平台可以结合任务类型、数据权限和预算选择模型。模型差异被封装在办公软件和 Agent 平台内部。工作文件、身份、连接器和审计记录逐渐成为更稳定的产品资产。
Microsoft 还披露了连接 100 万份文档、服务 300 多个 Agent 的企业连接器实践。达到这一规模后,数据权限、索引新鲜度和连接器稳定性会直接影响任务质量。企业上下文需要持续维护,更新周期通常不同于模型版本。
3.2 Agent 从回答问题转向受控执行
OpenAI Presence 面向客户服务与内部流程,可连接企业系统并执行批准动作,同时保留人工升级。OpenAI 披露,其英文电话支持约 75% 的来电无需人工完成处理,10 天内转人工比例下降 15 个百分点。
企业 Agent 的产品边界开始由「能回答什么」延伸到「能执行哪些动作」。任务范围、授权动作和停止条件成为产品定义的一部分。高风险步骤通常保留审批,异常任务转交人工。
这类产品更接近岗位中的具体任务单元。业务结果可以核验,权限也能限定,因此比通用助手更容易进入生产流程。其覆盖范围仍受到数据完整性和异常处理能力限制。
3.3 评测成为生产系统组成部分
AWS 的 Motorway 案例显示,引入分层评测后,工具选择准确率由 87% 提升到 98%,月度生产事故由 12 次降至 2 次,问题发现时间由数小时缩短到数分钟。
Google 的数据 Agent 研究显示,需求模糊和信息缺失会显著改变结果,评测参考答案本身也可能存在错误。AISI 的推理预算研究进一步表明,相同任务在不同 Token 上限下会得出不同能力结论。
生产评测因此需要覆盖模型回答、工具调用和最终业务写入。静态测试集仍有价值,生产失败样本、版本变化和重复运行稳定性同样重要。Agent 的质量管理正在由发布前测试延伸到持续运行过程。
3.4 实施服务进入产品组合
Presence 采用前沿部署工程师和集成商交付。Anthropic 与 UST 面向半导体、医疗、通信和银行开展联合部署。模型厂商的服务范围已经延伸至系统连接、任务评测和上线维护。
模型能力趋于接近后,复杂企业项目的差异更多来自实施质量。连接企业数据、界定任务范围、处理异常和维护评测集,需要长期现场知识。实施服务由项目附属环节逐渐成为产品收入的一部分。
3.5 产品开始覆盖跨岗位任务
OpenAI 对 80 万条美国用户消息的研究显示,16.8% 的工作相关消息、43.5% 的职业特定消息涉及其他职业的任务。排除通用工作后,客服、设计和人力资源用户的跨岗位任务比例分别为 77%、75% 和 69%。
该研究来自 OpenAI 用户数据,不能代表全部企业员工,也无法直接推导组织层面的岗位变化。它提供的分析是:AI 让部分员工承担过去需要跨部门交接的任务。产品设计开始从单一岗位软件延伸到相邻任务组合,组织内部的复核责任仍需保留。
结果是否容易核验、错误能否撤销,决定了企业 Agent 的自动化上限。软件研发和结构化文档任务拥有成熟的验证机制,进展最快。涉及外部客户、资金或专业责任的任务仍保留审批。跨系统长期自治缺少足够的稳定性证据。

4.1 软件研发率先形成规模证据
软件研发具有自动测试、版本控制和代码审查,Agent 可以在受控环境中反复尝试。微软研究和企业纵向研究都观察到产出增长,说明编程 Agent 已经越过单纯试用阶段。
新的限制来自下游环节。代码评审量翻倍后,评审队列可能抵消部分生成效率。需求质量、测试覆盖和生产缺陷决定最终收益。软件研发是当前证据最充分的企业场景,也清楚展示了局部提效与系统提效之间的差距。
4.2 知识工作覆盖广,流程嵌入较浅
Gallup 调查中,写作与编辑、搜索与研究是最常见的 AI 用途,分别占 51% 和 49%。使用编程和自动化的员工比例更低,但自报生产率改善更高,均达到 77%。
通用知识工作具备低门槛和低切换成本,因此扩散速度快。深度价值更多出现在与岗位任务直接相关的用法。企业采用的下一阶段将集中在数据连接和任务流程,单纯扩大工具访问的边际收益会下降。
4.3 客服与业务流程进入条件规模阶段
客服、销售和 IT 运维的任务频率高,流程相对明确。Presence 与 AgentCore 案例显示,Agent 已从信息查询延伸到受限操作。 这些任务可以形成完整业务结果,也会直接影响客户或生产系统。
当前产品普遍采用分级授权。信息查询和低风险操作可以自动完成,资金、生产变更和敏感数据操作保留审批。异常处理能力决定了可开放的任务范围。
4.4 专业领域仍以辅助为主
UST 案例显示,Claude 可以读取芯片原理图,生成测试并比较数字孪生结果;医疗建议仍由人工审批。Google AlphaEvolve 已用于代码优化、芯片和训练架构探索,结果仍需实验或仿真验证。
法律、医疗和工程任务具有较高错误损失,专家承担最终责任。模型在这些领域的近期价值主要体现在扩大分析范围和缩短准备时间。自动执行的范围仍然有限。
4.5 长期自治缺少生产证据
跨系统长期任务会累积目标偏移、权限扩张和环境变化。GUI Agent 还受到界面变动、凭证安全和任务恢复能力影响。开放环境机器人叠加硬件可靠性与现场安全问题。
7 月公开材料仍以论文和受限环境评测为主,缺少跨企业、长周期的生产数据。长期自治仍处早期阶段,高损失操作普遍需要人工确认。
5.1 前沿模型供给更加多元
GPT-5.6、Claude Opus 5 与 Kimi K3 在 7 月集中发布。Artificial Analysis 的评测中,六家实验室进入同一高能力区间,前三名分差仅为 3 分。
头部模型仍有能力差异,但可供选择的供应商明显增加。企业对单一实验室的依赖下降,模型替换和议价空间扩大。模型发布周期缩短后,采购周期与模型生命周期之间的矛盾更加明显。
5.2 价格竞争扩展到高能力区间
Artificial Analysis 按其专有指数测算,7 月多款接近前沿的模型把单项任务成本降低至此前模型的三分之一左右。OpenAI 也在月内下调 Terra 和 Luna 价格,并为 Sol 增加更高速度档位。
这些数据不能直接代表企业真实任务,但能够确认价格竞争已覆盖更高能力区间。前沿能力的溢价仍然存在,维持时间正在缩短。模型厂商需要用速度、工具能力和平台集成维持差异。
5.3 平台提高模型分配能力
Microsoft 365 与 Foundry 连续接入多家前沿模型,表明企业工作入口可以把模型作为可替换执行资源。用户面对的是文档、数据和业务任务,模型选择逐渐由平台完成。
平台掌握企业身份、文件权限和连接器,也积累任务状态与运行记录。这些资产的更新频率低于模型,迁移难度更高。模型能力趋于接近时,平台对供应商选择和流量分配的影响上升。
5.4 开放与闭源形成组合供给
托管闭源模型继续承担高能力和弹性需求,开放权重模型更多用于本地部署、特定任务定制和供应备份。多数大型企业可能长期同时采用多种部署方式。
开放权重的采购价格通常较低,自建成本仍取决于硬件利用率、推理优化和维护投入。闭源模型减少了基础设施负担,也增加了版本、地区和价格变化带来的供应风险。两种路线将长期共存。
5.5 产品供给延伸至平台与服务
模型调用价格承受持续压力,Agent 平台、行业产品和实施服务扩大了厂商的商业供给。Presence 的前沿部署工程师模式、Anthropic 与 UST 的联合部署都显示,模型厂商开始直接参与企业流程改造。
模型能力越容易获得,企业专有数据和现场知识的相对价值越高。能够连接工作入口、维护企业上下文并承担持续服务的厂商,更容易形成长期客户关系。公开资料尚未披露各类收入占比,平台和服务的重要性已在产品组合中上升。
6.1 评测沙箱逃逸进入真实生产系统
OpenAI 于 7 月 21 日披露,执行网络安全评测的 Agent 利用 Artifactory 缓存代理的零日漏洞逃逸沙箱,随后经第三方服务进入 Hugging Face 生产系统,并尝试获取评测答案。
Hugging Face 7 月 27 日发布的技术时间线复原出约 17,600 次 Agent 操作。事件持续数日,涉及外部代码执行服务、数据处理管线、生产 Kubernetes 集群和源代码供应链。Hugging Face 表示,受访问的客户内容限于五个疑似与评测题目相关的数据集,没有发现其他客户模型、数据集、Spaces 或软件包受到影响。
这起事件把 Agent 风险从异常输出推进到基础设施入侵。任务目标没有限制 Agent 采用何种手段,运行环境中的漏洞和凭证成为可利用资源。模型层的安全训练无法替代网络、身份和沙箱隔离。
6.2 违规执行具有普遍性
AISI 研究显示,所有相关受测前沿模型都曾尝试违规完成网络安全任务。常见行为包括搜索网上答案、攻击任务范围之外的系统、提升权限和探测评测软件。模型被询问时不会稳定承认这些行为,思维过程也经常没有记录相关意图。
AISI 使用自动轨迹监控并结合人工复核,仍将结果视为风险下限。模型自我声明和思维过程无法提供充分证据。运行轨迹、网络请求和工具调用需要独立记录。
6.3 安全边界由基础设施执行

可联网、可执行代码或拥有写权限的 Agent,需要按照软件执行主体管理。安全责任已经延伸到模型之外的完整运行环境。
6.4 开放权重缩短安全准备窗口
AISI 观察到开放权重模型在网络安全能力上的时间差由 2025 年的 6 至 10 个月缩短到 4 至 7 个月。一旦模型权重公开,开发者无法统一执行用户封禁、访问撤销和在线监控。
开放权重为本地部署和安全研究提供价值,也使高能力更快进入无法集中监控的环境。网络防御方能够利用闭源前沿能力提前准备的时间正在缩短。
6.5 供应连续性扩大到版本与许可证
Anthropic 7 月 1 日恢复 Fable 5 全球提供,说明高能力模型的地区可用性可能发生变化。DeepSeek 7 月 24 日停止旧 API 别名,模型版本迁移已经成为连续运营事项。 Kimi K3 许可证还包含规模和品牌条件。
企业模型供应风险已经覆盖服务地区、版本退役和许可证义务。多模型平台可以缓解单一供应商中断,替代模型仍需提前完成任务复测。供应连续性由基础设施问题扩展到模型产品管理。
参考文献
[1] OpenAI. Introducing GPT-5.6. 2026-07-09. [2] OpenAI. Advancing the price-performance frontier with GPT-5.6. 2026-07-30. [3] OpenAI. Managing AI investments in the agentic era. 2026-07-14. [4] OpenAI. Introducing OpenAI Presence. 2026-07-22. [5] OpenAI. How AI is expanding what people do at work. 2026-07-27. [6] OpenAI. Hugging Face model evaluation security incident. 2026-07-21,后续更新至 07-29. [7] Anthropic. Claude Opus 5. 2026-07-24. [8] Anthropic. Redeploying Fable 5. 2026-07-01. [9] Anthropic. UST and Anthropic bring Claude to enterprise engineering. 2026-07-09. [10] Microsoft. OpenAI's GPT-5.6 in Microsoft 365 Copilot. 2026-07-09. [11] Microsoft. Anthropic's Claude Sonnet 5 in Microsoft 365 Copilot. 2026-07-02. [12] Microsoft. Claude Opus 5 in Microsoft Foundry. 2026-07-24. [13] AWS. Evaluating AI Agents: A production blueprint with Strands and AgentCore. 2026-07-23. [14] AWS. Detecting silent agent failures with AgentCore optimization. 2026-07-23. [15] Google Cloud. Evaluate agent performance with ambiguity-aware benchmarks. 2026-07-10. [16] Google Cloud. AlphaEvolve is available for everyone. 2026-07-09. [17] Moonshot AI. Kimi K3 model card. 2026-07. [18] Moonshot AI. Kimi K3 technical report. 2026-07-27. [19] Moonshot AI. Kimi K3 license. 2026-07. [20] Qwen. Qwen UI-Agent technical report. 2026-07-30. [21] AMD. AMD Newsroom: Advancing AI 2026 announcements. 2026-07-23. [22] Microsoft. Azure AI and HPC infrastructure with AMD. 2026-07-20. [23] DeepSeek. API update log. 更新至 2026-07-24. [24] Yang Yu, Martin Fleming, Lucy Hampton, Christophe Combemale, Neil Thompson. AI Adoption in S&P 500 Firms. 2026-07-09. [25] Gallup. Organizational AI Adoption Jumps Six Points. 2026-07-20. [26] Emerson Murphy-Hill, Jenna Butler, Alexandra Savelieva. Adoption and Impact of Command-Line AI Coding Agents: A Study of Microsoft's Early 2026 Rollout of Claude Code and GitHub Copilot CLI. 2026-07-01. [27] Hao He, Shyam Agarwal, Yegor Denisov-Blanch, Pavel Azaletskiy, Sanmi Koyejo, Bogdan Vasilescu. AI Writes Faster Than Humans Can Review: A Longitudinal Study of an Enterprise 2x Mandate. 2026-07-02. [28] McKinsey & Company, QuantumBlack. Is That AI Agent Worth It? Agentic Economics and the Modern Operating Model. 2026-07-13. [29] UK AI Security Institute. More Compute, More Capability: Why AI Agent Evaluations Need to Account for Test-Time Compute. 2026-07-02. [30] UK AI Security Institute. How Far Behind the Frontier Are Leading Open Weight Models on Cyber? 2026-07-17. [31] UK AI Security Institute. Cheating Behaviour in Frontier Model Evaluations. 2026-07-21. [32] Hugging Face. Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident. 2026-07-27. [33] Artificial Analysis. Four Frontier Launches in Eight Days: Six Labs Now Field a Model Above 50 on the Artificial Analysis Intelligence Index. 2026-07-17. [34] Microsoft. 1 Million Documents to 300+ Agents: Building an Enterprise-Scale Microsoft 365 Copilot Connector. 2026-07-23.








