AI 的成本:企业如何管理规模化 AI 需求

作者:Pankaj Sachdeva(McKinsey 高级合伙人)、Wasim Lala(McKinsey 合伙人)、Avinash Javaji(McKinsey 副合伙人)、Kaavini Takkar(McKinsey 副合伙人)、Purva Arora(McKinsey 知识专家)
机构:QuantumBlack, AI by McKinsey;McKinsey Technology and AI 团队
发布时间:2026 年 7 月
分析归纳声明: 本分析忠于文章的核心判断、调查数据、案例和管理建议,对原文内容进行主线化整理与概念解释。除明确注明的麦肯锡调查、项目经验和外部研究数据外,文中对 AI 需求、资源消耗、支出与业务结果之间关系的串联,以及部分管理含义和章节衔接,是为呈现原材料内在逻辑所作的分析性归纳,不代表 McKinsey 或作者采用了完全相同的表述和分析框架。
AI规模化引发成本结构巨变 。随着企业AI从试验走向规模化,基础设施与模型的“按量计费”模式,叠加智能体(Agent)工作流的高频调用特性,正导致传统的“席位授权”与“历史基线”预算管理模式迅速失效。
成本超支与“影子支出”成为普遍痛点。 McKinsey最新调查显示,企业级AI应用支出已接近孤立用例的4倍。
预算失控: 93%的企业已超预算,多数预计未来12个月支出还将增长至少25%。 成本黑盒: 因分散采购,20%-30%的AI支出沦为未被识别的“影子成本”。 优化空间: 若引入系统性的AI FinOps优化,有望挽回20%-30%的成本消耗。
核心目标:从“算力计价”转向“业务算账”。 企业必须将分散波动的AI消耗,转化为可观测、可归因、可预测、可优化的业务投资。管理颗粒度需跨越单纯的“Token/模型单价”,深入到衡量“单次业务、单个工作流或单次交互”的单位成本,并持续与业务产出对标。
CIO的三大优先行动:
- 构建全局视野:
建立穿透供应商、模型、应用至业务部门的AI支出全景图。 - 核算核心ROI:
选取高价值业务工作流,试算其“单位业务结果成本”。 - 建立长效机制:
联合财务、采购与业务部门落地AI FinOps体系,依托AI网关、控制平面及自动化护栏,实现对模型调用、预算及风险规则的硬性管控。
McKinsey 今年的调研数据显示,随着企业 AI 应用从试验走向规模化部署,成本超支问题在调查样本中已经十分突出。调查中,受访企业的具体超支分布如下图所示,其中,仅 5% 的 AI 支出低于预算;93% 已经超支,其中 39% 超支不足 10%,46% 超支 10% 至 30%,另有 8% 超支更多,多数企业还预计未来 12 个月的 AI 支出将至少增长 25%。上述结果虽不能代表全行业现状,但当前的超支情况与未来的增长预期共同说明:依靠授权席位和历史用量编制预算,越来越难以跟上 AI 的实际资源消耗。

图 1:多数受访企业的 AI 支出已经超过预算
AI 账单的预算偏离预期并不只是由 AI 使用规模扩大造成,同时还受到用量波动、计费模式、企业治理能力、模型与工具选择以及 AI 应用开发门槛下降等因素的影响。这些变量相互叠加,既降低了历史数据对未来成本预测的参考价值,也增加了事后成本归因的难度,使企业难以判断费用具体由哪些用户、应用和工作流产生。上述因素具体表现为:
AI 使用模式不稳定,资源消耗难以预估。同一项业务任务可能调用不同模型、触发不同的智能体执行链,产生的 token 用量和最终费用也会明显不同。智能体工作流还会在单次交互中多次调用模型,使以往依据历史用量制定的预算容易偏离实际消耗。 按使用量计费让企业直接承担真实的调用成本。早期一些 AI 产品采用按席位打包收费,具体用量被包含在固定价格内。随着大语言模型服务转向按 token、接口调用和基础设施使用量收费,企业不再只为拥有多少账户付费,每名用户发起了多少任务、每项任务调用了多少资源,都会直接反映在账单上。 多数企业的 AI 成本治理能力仍不成熟。许多组织尚未建立统一的资源标签、成本归属、需求预测和采购规则,分散在不同厂商、平台、试验环境和业务部门中的使用数据难以汇总,企业即使知道总体支出,也未必能说明费用对应哪个产品、工作流或责任部门。 使用者缺少模型、工具和计价层级的选择依据。当质量、响应速度、风险和成本之间的权衡标准不清楚时,员工和开发团队容易默认使用高价模型或自己熟悉的工具,高价模型因而可能被用于简单任务。企业如果缺少相应的运行数据,也难以判断能否安全地换成成本更低的方案。 AI 辅助开发降低了应用搭建门槛,也推高了未受管理的资源消耗。普通员工现在可以快速构建 AI 应用、工作流和自主智能体,扩大业务创新范围的同时,也让更多 AI 使用发生在中央 IT 管理之外。员工还可能在不知情的情况下创建每天消耗数百万 token 的应用或自主智能体,难以及时发现持续累积的费用。
处理这些问题时,部分企业往往会借鉴传统云成本治理中的部分做法,例如统一记录用量、设置资源标签和明确成本责任。但是这些方法能够帮助企业看清费用由谁产生,却不足以解释同一项任务为什么会调用不同模型、消耗不同数量的 token,或者触发不同的智能体执行链。因此企业还需要把模型选择、API 调用、工作流设计和基础设施使用等 AI 特有变量纳入治理范围,才能进一步判断支出为什么容易超出预算。
AI 成本治理的第一步,是看清支出并说明成本来源。企业需要把分散在不同业务场景、模型和采购渠道中的使用量与费用,对应到具体用户、应用和工作流,说明支出由哪些业务活动产生。掌握实际消耗后,企业才有条件预测未来需求,并从模型选择、输入输出和智能体工作流等环节减少浪费。具体可以从以下四个相互衔接的方面展开:
1. 摸清 AI 支出去向,建立管理与预测基础
企业 AI 支出分散在云服务商、模型厂商、软件平台和业务部门的不同账户中,费用既可能来自企业级 AI 工具和基础模型合同,也可能来自软件内置功能、API 调用和试验环境。由于采购渠道和计费方式各不相同,部分支出没有进入统一统计。根据 McKinsey 的项目经验,这类未被统计的费用可能占企业 AI 总支出的 20% 至 30%。因此,企业需要结合费用账单与实际使用数据,把每笔消耗对应到具体用户、应用和工作流,弄清资金流向及其背后的业务需求。
McKinsey 的调查还统计了企业在支出可视与归因、token 消耗跟踪、成本分摊以及预测和预算四项基础能力上的成熟情况,具体如下图所示:

图中四项能力达到成熟水平的企业均不超过四分之一,说明不少企业还没有打通从用量记录、费用分配到预算预测的基础环节。企业不仅要弄清已经发生的支出,还要预测未来的资源消耗,而智能体执行过程的不确定性进一步增加了预测难度。一项针对智能体编程任务的研究显示,执行同一项任务时,token 用量最多可能相差30倍。这一结果虽不能代表所有业务场景,但足以说明任务数量不能直接等同于资源消耗。历史业务量只能提供部分参考,预测时还要考虑用户增长、工作流扩展、路由策略变化,以及前沿模型与开放权重模型之间的切换。
要持续开展支出追踪和需求预测,企业需要建立由技术、财务和业务部门共同参与的 AI FinOps 机制,并由集中式 AI 控制平面提供数据和技术支持。AI 控制平面统一记录使用量、成本、性能和业务结果,并在模型调用过程中执行相应的管理规则;AI FinOps 则利用这些数据预测需求、分析成本来源,并把支出与业务结果对应起来。
当模型调用记录能够对应到业务部门、产品、工作流和业务结果时,企业便可以判断成本增长究竟来自使用规模扩大、模型选择变化,还是智能体调用次数增加。这些数据也能用于明确费用责任:成本展示让业务部门看到自身产生的 AI 费用,成本分摊则把费用计入相应的部门、产品或用例。业务部门和成本负责人由此可以依据同一组数据比较投入与业务结果。不过,token 只能反映资源消耗量,企业还需要进一步计算完成一项任务、处理一笔业务或支持一次客户交互所需的成本。
2. 优化支出
企业弄清 AI 费用花在了哪里、由哪些业务产生后,才有依据进一步优化成本。多数企业最初把成本优化理解为选择更便宜的模型,但模型价格只是其中一个变量,token 用量、路由方式、智能体行为和工作流结构同样会改变最终费用。主要可以从六方面入手:
为任务选择合适的模型。 分类、文本摘要、固定格式生成等简单任务,可以使用成本较低的模型;复杂推理、代码生成、多模态处理、智能体工作流,则可能需要能力更强的前沿模型。企业应在满足任务质量要求的前提下选择成本较低的模型,同时考虑响应延迟、业务风险和服务可用性。 减少无效输入。 企业可以缩短提示词,限制上下文范围,只传入相关文档和工具输出,并在重新发送较长的对话历史前先进行摘要。对于具有较长、稳定前缀的检索增强生成和智能体任务,提示词缓存最多可减少约 90% 的重复输入 token 成本。 控制输出 token。 企业可以针对不同任务规定回复格式,在合适场景中使用结构化输出,并限制回复长度,减少模型生成与任务无关的内容。 控制智能体和工作流的调用次数。 企业可以为任务重试、工具调用、智能体循环和升级处理路径设置上限,对于反复失败或结构不合理的流程,应优先调整上游任务设计,而不是继续增加智能体或调用次数。 采用批处理和缓存。 对实时响应要求较低的大批量任务,可以采用批处理;重复提示词、稳定上下文和可复用的中间结果则可以缓存,避免为相同推理反复付费。 有选择地使用开放权重模型。 对于不需要前沿模型能力的简单任务,企业可以考虑使用开放权重模型。这类模型可以由服务商托管,也可以由企业自行部署,以此降低部分模型使用成本(但实际效果仍取决于托管方式、工作负载规模和企业的运维能力)。
3. 现代化采购并建立财务责任
AI 成本优化涉及模型、服务商和部署方式的选择,成本管理也因此延伸到采购环节。AI 服务越来越多地采用按使用量计费,模型能力、价格和业务需求也在持续变化,使依赖席位授权、年度合同和固定需求预测的传统采购方法越来越难以适用。为解决这种现象,企业需要回答两个问题:AI 消耗产生的费用应当由谁承担,以及所需的 AI 能力应当通过什么方式获得。
建立 AI 成本责任模型,明确费用归属。建立 AI 成本责任模型时,首先要把使用情况、费用和业务结果对应起来,弄清谁在使用 AI、费用产生于哪些产品和工作流,以及相应消耗带来了什么价值。有了这层对应关系,企业才能把 token、API、基础设施和模型费用计入相应的业务部门、产品或用例,并通过成本展示和成本分摊机制明确费用由谁产生、由谁承担。自动化护栏解决的是运行阶段的问题:它在调用过程中监测使用量、执行管理规则,并识别反复重试、上下文冗余和智能体执行链过长等低效行为。成本责任机制与自动化护栏配合后,企业既能说明费用由谁产生,也能判断哪些执行环节推高了成本。 选择合适的 AI 能力获取方式。 企业选择 AI 能力的获取方式时,已经不能只在“采购”和“自建”之间二选一,而要根据工作负载的性能要求、成本、风险和业务价值,在采购、自建、托管、路由和切换之间寻找合适的组合。服务商托管可以减少基础设施和运维负担,但企业仍需依赖外部服务商提供扩容、可用性和部分数据治理能力;自行部署能够加强对数据、定制、延迟和规模成本的控制,但需要更强的工程、MLOps、安全和基础设施能力;较小的本地模型则适合摘要、低频分类和翻译等风险较低、对模型能力要求不高的任务。这些选择不仅决定模型如何运行,也会影响企业向谁采购、如何付费以及采用什么合同安排。由于模型能力、服务商和部署位置需要随业务负载持续调整,AI 采购很难像传统软件采购那样在项目启动时一次确定,二者的主要差异如下表所示,这意味着企业需要结合实际用量、模型表现、成本、风险和业务结果,持续判断是否调整模型、服务商或部署方案。传统软件采购AI 采购按席位授权按使用量计费单一供应商策略多模型生态固定需求预测动态需求管理长期合同承诺灵活的商业安排定期基准评估持续基准评估
4. 将治理直接嵌入 AI 架构
采购阶段只能确定企业可以使用哪些 AI 能力,实际成本则取决于员工、业务应用和智能体在运行过程中如何调用这些能力,包括选择什么模型、传入多少上下文,以及一项任务可以重试多少次。过去几年,企业主要鼓励员工扩大 AI 使用范围,如今则需要引导他们更合理地使用 AI,但模型选择、上下文范围和任务重试次数等问题,很难只靠培训和员工自觉进行持续控制,因此企业必须进行 AI治理,并把成本与风险规则纳入到治理中。
具体来说,企业可以把治理能力嵌入 AI 运行架构,让规则在模型调用过程中执行。AI 网关、AI 控制平面、策略引擎和自动化护栏可以检查模型调用是否获得批准,监测资源消耗,执行预算限制,控制不必要的上下文扩张,并在成本或风险超过预设范围时触发升级处理。这样一来,企业不必等到月末核算时才发现问题,而是能够在模型调用过程中实施约束。AI 运行架构负责执行规则,但规则的具体内容仍需企业事先确定。业务、技术、财务和风险人员需要共同决定允许使用哪些模型、预算上限设在哪里、上下文可以有多长,以及什么情况下需要升级处理;成本、质量和风险之间如何取舍,也需要结合业务价值作出判断。企业将这些要求写成明确的系统配置后,架构层的治理才有具体的执行依据。
面对持续增长的 AI 支出,CIO 不应只考虑削减预算,还要管理 AI 需求,让有限的 AI 资源优先进入能够创造更高价值的业务工作。具体可以从六项工作入手:
在费用快速增长前建立预测能力。企业需要先弄清资源消耗发生在哪里、成本由什么因素推动,以及哪些业务场景正在创造价值,再预测用户增长、工作流扩展、模型价格和路由策略变化带来的影响。AI 业务方案除了预期收益,还应包括预计用量曲线、敏感性分析和单位业务结果成本,为不同情景下的预算和资源安排提供依据。 建立以业务价值为基础的责任模型。CIO 需要与财务和业务负责人合作,把 AI 使用量与产生需求的产品、工作流和业务部门对应起来企业衡量 AI 投入时,应逐步从单独统计 token 转向每笔理赔的处理成本、每个 AI 工作流创造的收入等业务指标,从而判断哪些用例正在创造价值,哪些用例消耗了资源却没有产生相应回报。 优先投入企业最有价值的工作流。CIO 和业务负责人需要识别能够提高生产率、增加收入、改善客户体验或降低风险的工作流,优先把 AI 资源投入最可能产生明显业务结果的环节,再将由此节省的成本或新增收益投入其他技术项目。 保留采购和技术选择的灵活性。模型能力和价格持续变化,当前合适的模型或服务商,几个月后未必仍然合适。企业应避免被僵化的商业安排和封闭的技术栈锁定,架构需要支持多家模型服务商,允许工作负载在专有模型与开放权重模型之间迁移,并定期重新评估模型和部署位置。 在支出达到较大规模前建立长期运行的 AI FinOps 团队。这支跨职能团队负责预测需求、监测资源消耗、识别优化机会、评估采购方案并衡量单位业务结果成本。团队需要持续跟踪模型价格、技术能力和业务需求的变化,并及时将这些变化纳入 AI FinOps 工作。它应当作为企业的长期职能运行,而不是一次性的临时项目组。 把治理持续嵌入 AI 运行环境。随着 AI 使用范围扩大,企业无法依靠人工逐次检查所有调用。CIO 可以通过 AI 网关、AI 控制平面、策略引擎和自动化护栏,把适合的请求路由给成本更低的模型,执行预算限制,控制不必要的上下文扩张,监测智能体行为,并在费用或风险超过预设范围时触发升级处理。最终目标是让符合企业成本和风险要求的选择成为系统默认选项。
AI 正迅速成为企业规模最大、增长最快的技术支出类别之一,当其成本上升时,单纯削减预算并不能解决问题,企业仍然需要判断用量会如何变化、费用由谁产生,以及这些支出是否带来了相应的业务价值。CIO 需要管理的不只是预算总额,还包括哪些任务值得使用 AI、应当选择什么模型,以及完成一项业务任务实际需要多少成本。企业需要持续预测需求、约束消耗,并比较每项业务结果的成本。模型价格、技术能力和业务需求都在变化,这些管理工作也要随之调整。企业能否从不断增长的 AI 支出中获得相应的业务价值,取决于这套管理能力能否长期运行。








