AI 普及之后,企业竞争进入“组织能力重构”阶段——解读 OpenAI Enterprise Signals

企业 AI 的应用正站在一道分水岭上,模型开始跳出问答交互的阶段,逐渐转向各类实际业务的落地执行。然而,即使能够使用相同的 AI 模型,不同企业推进应用的速度也并不一致。这种分化主要体现在:模型如何进入实际工作,企业是否把实质性任务交给智能体,是否为智能体提供必要的上下文和工具,以及是否将其产出接入业务流程。从 OpenAI 汇总的企业使用数据中,可以进一步看到这场转变及其分化的五个具体信号:
截至 2026 年 6 月,按输出 Token 计算,企业客户的 Codex 使用量占 Codex 与 ChatGPT 合计使用量的 64%,智能体型使用已经占据多数。
目前前沿企业(前10%)每位活跃用户产生的输出 Token 是典型企业(45%~55 %)的 8.3 倍,而今年 1 月这一差距还是 2.6 倍。
前沿企业每周有 21% 的活跃用户使用插件、19% 使用技能,典型企业的对应比例为 9% 和 3%,OpenAI 内部每周有 95% 的活跃用户使用插件。
今年 2 月以来,企业 Codex 周活跃用户在法务岗位增长 108 倍、销售和招聘各增长 41 倍、营销增长 26 倍,工程岗位增长 5 倍,增速最快的使用群体已经扩展到非技术岗位。
AI 使用率在职业生涯早期的员工中最高,并随着员工资历加深而下降。
企业 AI 的使用方式正在从请求帮助转向委派任务。目前,ChatGPT 这类聊天工具主要帮助员工提问、梳理思路和打磨想法,后续执行仍主要由员工完成,Codex、ChatGPT Work 等智能体则为模型提供操作计算机的工具,使其能够查找信息、修改文件,并自主或在人员监督下推进多步骤任务。人机协作的工作单元也在改变。聊天模式下,员工获得回答后继续完成后续操作,智能体模式下,员工可以交代目标、业务背景和验收标准,让模型把多项操作串成一项完整任务。因此“有没有使用 AI”已经不足以衡量采用程度,当下更需要观察的是 AI 实际接手了哪些业务环节。
如图所示,智能体型使用已经从很小的占比发展为企业客户输出 Token 的主要组成部分。截至 2026 年 6 月,按 28 天移动平均计算,Codex 占企业客户 Codex 与 ChatGPT 合计输出 Token 的 64%,一年前的 2025 年 8 月,这一比例还接近零。

AI在整体上的用法发生变化,但不同企业并没有以相同速度加深应用。由于Token 更适合作为观察 AI 使用深度,以及员工交给 AI 多少工作的替代指标,OpenAI 依据企业客户每月每位活跃用户产生的输出 Token 量进行排序,当月排名前 10% 的企业定义为前沿企业,处于 45‑55 百分位区间的企业定义为典型企业。如下图所示,截止到 2026 年 6 月,前沿企业每位活跃用户产生的输出 Token 已经是典型企业的 8.3 倍,而今年 1 月这一差距还是 2.6 倍。

将观察周期拉长后这一分化更加明显。以 2025 年 4 月典型企业的人均输出 Token 为 1.0,到 2026 年 6 月前沿企业指数已升至 17.1,典型企业则为 2.1。再分行业进行分析,如图所示,信息与科技行业的差距最大,为 11.7 倍;制造业最小,但仍达到 5.3 倍。各行业典型企业过去一年的增幅介于 1.9 倍至 2.8 倍,意味着许多组织可能仍以简单的聊天式使用为主,在利用智能体完成复杂工作方面仍有较大空间。
尽管上述数据还不能反映出组织制度、员工能力和任务性质分别在实际中分别贡献了多少差距,但也足以确认前沿企业正在比典型企业更快加深应用。


从前沿企业的实践中能够清晰看到,企业 AI 正沿着由内向外拓展的发展路径。早期AI主要帮助员工查找信息、起草文档、分析数据、编写代码和自动处理常规流程,随着能力加深,AI 开始从内部生产力工具进入面向客户的产品、服务和体验。这一步的转变也改变了企业观察成效的方式。内部助手提供的草稿或建议可以在组织内部反复调整,面向客户的 AI 可能进入理赔申报、诊断报告、产品发布和客户答复,容错空间更小,AI 是否真正进入了工作流程能够从发布周期、任务完成率、识别准确率和成本节约等业务结果明显反映 。
OpenAI 给出了如下的八个企业案例,覆盖了软件开发、安全、产品发布、保险理赔、医疗诊断、内部运营和研发。它们没有采用一套统一指标,而是通过衡量缺陷修复、漏洞识别、发布周期、理赔完成、病例诊断、成本节约和研发效率来反映 AI 已经进入哪些具体业务环节。

从使用方式看,前沿企业除了注重将 AI 融入业务之外,还会更频繁地使用插件和技能等高级能力。例如,销售插件可以把团队销售手册与 CRM 系统连接起来,让智能体调用最新客户信息和历史方案,起草定制回复,再交由人员审核。OpenAI 给出的数据显示,在每周活跃用户中,前沿企业有 21% 使用插件、19% 使用技能;典型企业的对应比例只有 9% 和 3%。OpenAI 透露,其内部每周有 95% 的活跃用户使用插件,说明这些能力仍有进一步普及的空间,但这一内部比例不适合直接作为其他企业的考核指标。

进一步分析前沿企业和典型企业之间的数据,可以看出两者在技能采用率上的差距比插件上的更大。一个可能的解释是,把分散在团队中的经验整理成智能体可以重复执行的操作说明,是企业从零散试用走向稳定工作流时较难普及的一项能力。不过,采用率差距只能说明用法不同,并不等于技能用得越多,业务回报就一定越高。插件和技能只是能力入口,智能体能否完成整项任务,还取决于这些能力如何组合。
OpenAI 财务团队的实践直观演示了各项智能体能力该如何组合落地。业务数据与经过授权的信息来源提供上下文,将表格、仪表盘、邮件、银行业务作为操作对象,同时在结果流入正式业务流程前设置人工审核环节。OpenAI 一共公开了四个具有代表性的工作流:
优化营销投入:把分散的活动数据转化为投资回报曲线,每周建议下一笔营销预算投向哪里可能获得更高回报。
保持损益报告同步:连接损益数据、表格、仪表盘和管理层报告,识别关键驱动因素并审计产出。
支持投资者尽调和融资:依据经过批准的来源准备答复和会议材料,再把定稿内容沉淀为可复用的组织记忆。
运行相互连接的资金管理流程:把邮件与银行项目连接起来,标记阻碍因素,跟踪 KYC(客户身份识别)和后续事项,建议下一步并起草回复。
这类工作流不再是简单的一问一答模式,而是连接多套数据源与工具,输出可直接提交审核、可供后续复用的成果。(说明能力如何组合,但不代表所有前沿企业都采用相同流程)
在智能体能力落地的同时,当下的智能体也开始逐渐支持更长周期的工作,因此,与执行能力对应的风险审核边界也需要进行配套设计。例如,“非工作时段执行”能力允许智能体在夜间处理优先级最高的待办任务,但仅生成待人工复核的草稿;在没有人员审批的前提下,禁止发送、发布或对外分享任何内容。总的来说,智能体的自主操作权限越大,就越要在高风险操作前筑牢人工审核防线。
随着智能体进入企业工作,对智能体开放企业系统访问权限也会带来新的风险。前沿企业需要明确智能体可以在哪里运行、访问哪些信息、何时采取行动,以及由谁审核高风险决策。随着组织从真实部署中积累经验,这些控制规则也需要持续调整。这类控制规则无法一次性定稿,需要根据真实部署中积累的经验持续迭代完善。考虑到控制规则只能约束智能体的行为边界,无法让成熟的使用经验在组织内部自动扩散,因此,前沿企业也将试错与学习纳入日常工作,通过实操工作坊、案例交流论坛、内部成果分享等形式,把个体的实践经验沉淀为跨团队的组织能力。
从网络安全角度来对上述进行检查,最能考验这套落地思路在高风险环境下的实际表现。代码库给模型提供业务上下文,借助安全工具和多步骤执行能力,智能体可以完成漏洞排查、输出修复建议并跟进处置流程。在对漏洞进行排查后,真正的卡点往往在排查之后的漏洞确认——确认漏洞是否属实、划分修复优先级、完成补丁测试,再由安全团队完成审核和部署。智能体承担了发现问题、采取行动的工作,所以企业必须做好结果校验、优先级梳理和全流程处置闭环,才能真正变成安全防护能力。只有任务执行条件、风险管控规则、组织经验沉淀这三者相互配合,智能体的工作模式才可以顺利复制到更多业务岗位。
在企业内部,软件开发者是智能体的早期使用者之一,但当前增长势头最强的已经转向一般知识岗位。如图所示,统计以各岗位 2026 年 2 月 1 日的周活跃用户数作为基准 1,用以衡量各岗位相对自身年初的增长幅度。企业 Codex 周活跃用户数据显示,法务岗位增长 108 倍,销售、招聘岗位分别增长 41 倍,营销岗位增长 26 倍,工程岗位增长 5 倍。除此之外,OpenAI 还观察到使用者存在明显的资历分化现象,职业生涯早期员工的 AI 使用率最高,并随着员工资历加深而下降。

软件开发者之所以会成为智能体的首批使用者,源于开发场景得天独厚的条件。代码库可以提供清晰完整的上下文,测试流程能够快速验证输出结果,编程相关的技术迭代还可以反哺 AI 模型本身的研发。过去两年间,开发者的使用模式也发生显著变化,已经从单纯依靠 AI 补写单行代码,升级为把完整的开发任务交给智能体完成;开发者自身的工作重心,也逐步转向任务拆解、智能体编排以及结果审核。与之形成对比的是,一般知识工作的智能体落地进度此前一直偏慢,主要受三重现实约束:任务可利用的上下文有限、业务需求难以精准描述,同时缺乏清晰可落地的验收标准。不过,随着模型规模持续扩大、强化学习技术取得进展,叠加基于 GDPval 等真实工作评测基准开展定向优化,能力领先的模型可支持的任务、工具与业务场景正在不断拓宽,这也为一般知识岗位的爆发式增长打下基础。
OpenAI 针对企业内部不同岗位的智能体实际工作行为开展调研。通过对超 1000 万条企业对话消息做分类统计可以看到:ChatGPT 最主流的使用场景依旧是内容写作,而在智能体会话当中,编程、系统及智能体相关操作占比合计接近 75%。分岗位来看,招聘、销售、政策与传播岗位的消息里,用于系统及智能体操作的占比分别达到 32%、26%、25%、24%;设计岗位的智能体会话中,编程相关内容占比接近 60%。这些数据反映出两种模式的分工差异,聊天模式主要承担内容生成与信息处理工作,智能体模式则更多介入代码编写、系统调用与业务流程操作。并且也能看出,普通知识岗位人员已经开始大规模使用智能体,技术类任务也正在向非技术岗位渗透。


将观察视角从企业内部放大到跨行业维度,各行业的 AI 落地路径差异进一步凸显。近一个月数据显示,专业、科学与技术服务业的 Codex 渗透率与 API 使用强度双双领跑,艺术、娱乐及休闲行业的 ChatGPT 渗透率最高,制造业则拥有最高的 ChatGPT 使用强度(图表中标注的名次升降,代表的是相对上月的排名变动,并非采用率或使用强度的实际涨幅)。总体看来,不同行业的 AI 建设并非走统一路线,一部分行业依托开发者工具与 AI 产品完成落地,另一部分行业则体现为终端用户日常使用覆盖面更广、使用频次更高。









