智能体经济学不是 Token 定价问题

两天之内,麦肯锡发布了两份本应放在一起阅读的报告。8月24日,QuantumBlack 发布了一份关于智能体工作流经济学的实用指南。8月25日,该公司发布了其《2026年人工智能现状》调查报告。将两者对照阅读,便能明白为什么本月的降价不会体现在大多数公司的业绩中。
先看调查报告。十分之八的受访者表示人工智能提升了他们个人的生产力。然而,认为人工智能对本组织息税前利润(EBIT)有贡献的受访者比例仅为37%,与一年前基本持平。约五分之一的组织表示,人工智能的运营成本已经在制约其使用方式,尽管大多数组织预计明年将增加人工智能投资。智能体正在扩散,但并不均衡:营收超过10亿美元的公司中,报告正在规模化部署智能体的受访者比例达到40%,高于此前的27%;而规模较小的组织则维持在22%,没有变化。
这份指南解释了这一差距的大部分成因。其中最有价值的一节标题却很朴实:Token 有时并非最大的成本。在麦肯锡给出的银行业案例中,Token 费用仅占运行客服智能体可变成本的20%至25%,而风险与业务专家的人工监督则占了70%至75%。一些银行面向客户的智能体,若以单智能体工作流运行,成本可达2万至3万美元;若以多智能体团队运行,成本可达10万至20万美元。业务量会改变这笔账:用对话式智能体为每年2500名客户办理开户,成本为1万至1.5万美元,而业务量翻倍后,成本仅上升至1.5万至2万美元。
这与本月的价目表完全是两个话题。OpenAI、Anthropic 和 Google 在7月下旬到8月中旬期间纷纷调整了单价。而麦肯锡告诉买家,单价本身就是一个错误的关注对象。它优先提出的指标是“已完成工作的投资回报率”:即用人力、智能体和确定性系统共同完成任务的全负荷成本,与所产生的价值相比较。
智能体是一套包含重试、工具和审核者的工作流,其失败模式最终会落到某个人身上。把它当作一个恰好按 Token 计费的廉价员工来定价,会漏算账单中的大部分内容。
真正发生变化的是什么
麦肯锡7月的研究已经援引关于智能体编码任务的研究提出警告:智能体消耗的 Token 量可能是单轮编码或对话的约1000倍,同一任务的不同运行之间差异可达约30倍。8月的这份指南则为这些数字套上了一个总成本框架。
如今,四类成本被摆在了同一张表上。
第一,Token 与思维过程记录。即便使用更便宜的主力模型,一旦智能体进行规划、调用工具、重试并反复发送长期存留的上下文,成本依然会成倍增加。
第二,固定层成本。麦肯锡将人工智能基础设施与智能体编排——包括在生产环境中维护智能体的数据科学家——计为每个智能体的固定成本。多智能体团队会因交接、共享记忆以及为协调冲突步骤而产生的额外调用,让这一层变得更重。只有在这一层的成本被覆盖之后,业务量才能带来规模效益。
第三,人工监督。在麦肯锡的开户案例中,10%至20%的运行会被转交给风险与业务专家处理。这名审核者的成本应当计入智能体的单位成本,若将其归入单独的“变革管理”科目,就等于把它藏了起来。
第四,智能体被允许接触的工作类型。写入操作、客户消息、申报文件和生产环境工单所对应的预期损失,与一份从未离开 Slack 的草稿截然不同。
只盯着每百万 Token 成本的财务团队,会批准错误的系统,也会扼杀正确的系统。一个能够撤掉四人处理队列的工作流,即便 Token 账单很高,也可能是划算的;而一个每五次输出就需要律师审核一次的工作流,即便 Token 账单极小,也可能是昂贵的。
为什么负责人现在就该关注这个问题

调查中的 EBIT 数字与指南中的监督成本数字,从两端描述的是同一个问题。智能体试点失败的方式,和廉价模型迁移失败的方式如出一辙:演示衡量的是模型本身,而生产账单衡量的是整个系统。
这种失败模式相当具体。某团队展示智能体能“处理”开户或工单分流工作,与全负荷薪资相比,Token 成本看起来微不足道。上线之后,异常率居高不下,上下文窗口不断扩大,原本应当被解放出来的资深员工,如今却在审核机器输出。Token 账单是唯一容易看到的数字,于是它成了论据;而监督成本仍然留在薪资预算里,从未进入商业论证。这就是为什么个人工位上的生产力在上升,而 EBIT 却原地踏步。
另一种失败发生在天平的另一端。一些领导者因为多智能体架构在幻灯片上看起来很贵,就冻结了相关工作,却没有去问业务量是否能摊薄那部分固定成本。麦肯锡的算术给出了提醒:平台一旦建成,增量运行的成本可以很低。在其开户案例中,为一名客户开户的全负荷成本可以从约50至150美元降至约10至30美元——但前提是必须有人负责路由、上限设置和审核。
这份调查还带来了第三个值得关注的信号。32%的受访者表示,其所在组织决定放弃购买至少一款软件产品或功能,因为可以借助智能体编码工具自行开发。这确实可能节省真金白银,但也把原本属于供应商的成本,转移到了你自己的运行预算、你自己的审核队列以及你自己的责任之中。
对于你即将规模化部署的智能体:运行成本中有多大比例是 Token,又有多大比例是仍需人工审看的部分?当这两个数字同时变化时,谁来为这次运行负责?
“模型变便宜了”这种虚假的安全感

本月的降价并不能拯救一个设计糟糕的智能体,只会让人更容易、更频繁地运行一个设计糟糕的智能体。
以 Luna 级低价完成的第一步调用,只有在第二步设有闸门的情况下才划算;一旦每一次廉价调用都能触发具备写入权限的工具,它就会变得昂贵。以 Flash 级低价运行的编码智能体,只有在重试次数受限、代码差异经过审核的情况下才划算;一旦它整夜对着一个无人看管的代码仓库运行,它就会变得昂贵。
供应商的价目表会按照自己的节奏继续涨涨跌跌。但监督比例只有在企业主动通过设计将其降下来时才会下降:更好的检索机制,让智能体一次就能找到正确的文件;更清晰的写入权限;带有服务级别协议(SLA)的审核队列;以及当运行间差异过大时的停止规则。
麦肯锡给出的答案是建立“AgentOps”能力,也就是智能体版本的 FinOps:由一个跨职能团队持续管理支出,并将人工智能的单位经济学纳入季度业务评审。这项工作属于运营职能,采购部门无法独自完成。
DNLA 智能体经济学行动手册
- 为整个工作流定价。Token、编排、审核时间、异常处理,以及写入操作带来的预期损失,都应当列在同一张表上。
- 将固定的平台成本与可变的运行成本区分开来。只有在平台真正建成之后,业务量才能带来规模效益。
- 既要衡量平均值,也要衡量方差。运行之间出现30倍的波动,本质上是一个控制问题。
- 在上线前就为循环、重试和上下文增长设置上限。长期存留的上下文是一项反复产生的费用。
- 指定一名运行负责人。当监督负荷或 Token 波动超出预算范围时,必须有人能够叫停智能体。
- 把人工审核作为一项常设成本纳入预算。如果设计方案假定10%至20%的运行需要专家介入,就要为这位专家单独预留预算。
- 当智能体开始取代软件采购时,重新审视“自建还是购买”的决策。使用编码智能体自行开发,依然会给你留下运行成本、审核成本和责任。
DNLA 观点
8月中旬的价格战回答了一个大多数董事会早已用错误方式提出的问题。Token 价格固然重要,但它并不能决定一个智能体是否能收回成本。一份调查显示,十分之八的人感觉自己生产力提升,而报告 EBIT 受到影响的人却不到十分之四——这正是这种误判在规模化之后的样子。
只有当一次全负荷运行——包括模型、工具、重试以及仍需签字的那个人——的成本低于它所取代的工作,并且质量足以让企业站得住脚时,智能体才算收回了成本。这个数字不会写在价目表上,它存在于工作流之中。
如果你说不清楚一个智能体在糟糕的一天里要花多少钱,那你手上就不是智能体经济学,而只是一张 Token 账单,外加一个“但愿监督不花钱”的期望。
想让同样严谨的方法应用到你自己的人工智能系统上吗?
这正是 QAi 健康检查存在的意义。