为何企业AI的成本问题在于推理而非训练?
若询问大多数企业AI预算流向何处,他们通常会指向训练过程,或是刚刚签署的前沿模型合同。但在实际生产环境中,这两种答案都偏离了重点。对于绝大多数仅使用模型而非自行训练模型的组织而言,企业AI的成本是在推理阶段确定的,而这一成本由一个几乎无人审核的决策所决定:即由哪个模型来响应每个请求。
如果在大规模应用中做出了错误的决策,费用就会以无人能预料的方式激增——这正是Gartner预测到2027年底将有超过40%的自主AI项目因成本不断攀升和商业价值不明而取消的主要原因之一。
那个悄然推高账单的默认设置
直观的设计是选择一个强大的模型,并将所有请求都通过它处理。这看似是安全的选择,但可能代价高昂。企业工作负载几乎从来都不是均匀的,大部分请求是寻常事,例如分类记录、提取字段或总结文档,而只有一小部分是真正困难的:多步骤推理、模棱两可的输入,以及会产生实际后果的决策。
将每个请求都发送给前沿模型,意味着要为那些本可由更小模型同样处理的分流工作支付前沿token的价格。由于系统运行正常,无人对其进行重新审视,成本会随着采用率的提升呈线性增长,直到最终进入预算审查环节——尽管项目已正常运行,却仍可能被取消。
路由机制将模型选择转化为按请求决策
解决之道在于架构设计,而非合约条款。模型路由将模型选择视为针对每个请求的决策,而非针对整个系统的一次性决策。一个轻量级分类器(可以是小型模型、嵌入向量加规则层,或是经过训练的评分器)会评估每个传入请求的难度,并将其发送至能够处理该请求且成本最低的路径,仅在必要时才升级至前沿模型。
在生产环境中,这形成了一条分层链:低成本执行器处理大部分工作,中层评估器监控输出质量并标记模糊情况,而前沿模型则专门用于处理真正需要它的那部分请求。
节省的成本是可观的。在我参与的一次生产环境迁移中,将工作负载从单一前沿 API 迁移到基于托管基础设施的分层路由架构,在完全不改变应用逻辑的情况下,将AI基础设施成本降低了42%。若将此模式扩展到代理密集型工作负载(其中一项任务可能涉及数十次模型调用),分层模式可将运营成本降低60%至80%。应用程序的性能并未下降,而是架构在资金投入方面变得更加明智。
成本泄漏点在于阈值,而非模型
这是大多数团队容易犯错的地方,也是任何管理推理预算的人必须掌握的核心理念。团队往往将精力投入到路由准确性上,即分类器是否正确标注了请求,却对升级阈值(即请求被转交给昂贵模型的置信度临界点)投入不足。
如果阈值设得太低,所有请求都会被升级,结果你又得为所有请求支付前沿模型的价格。如果设得太高,那些真正重要的棘手案例的质量就会下降。
阈值是一个可调的商业决策,而非固定常量。它应当被纳入监控体系:记录每次升级,追踪高成本模型是否确实产生了实质上更好的结果,并根据这些结果数据调整阈值。实际上,这个单一的调节旋钮决定了大部分实际节省的成本,也决定了大部分被浪费的支出。
为何这是基础设施问题,而不仅仅是建模问题
对于运营数据平台和管理计算预算的人员而言,“路由”以一种有益的方式重构了关于AI成本的讨论。优化的单位不再是模型,而是请求及其在系统中的路径。这使得成本成为一种可设计和衡量的属性,就像你对待存储层级、查询规划和缓存命中率一样。
这也意味着,最经济的解决方案往往并非采用更小的模型,而是更明智地决定何时调用大型模型——这正是数据与AI咨询公司接手失控的推理账单时所进行的优化,而且这完全是一个工程和可观测性问题,您的团队已经具备解决它的能力。
这也会改变采购方式。当成本由架构决定时,问题就不再是标准化采用哪一个单一模型,而是如何组合不同层级进行路由——理想情况下应跨服务商部署,以免单个供应商的定价主导您的账单。2026 年能够控制推断成本的组织,并非那些找到了更便宜合同的组织,而是那些不再为根本不需要尖端模型的工作支付尖端价格的组织。
针对自身推理账单的简要审核
如果想了解自己的AI支出是否存在推理路由问题,以下四个问题能快速帮您查明:
统一路由:无论难度如何,每个请求是否都发送到同一个模型?如果是这样,您几乎可以肯定是在为占绝大多数的常规请求支付了过高费用。
阈值:如果采用路由机制,您的升级阈值是否根据结果进行了监控和调整,还是仅设置一次后便被遗忘?
归因:您能否按层级查看每次请求的成本,还是只能看到单一的月度总计?无法归因的成本就无法优化。
浪费的支出:您是否衡量了那些未能改善结果的升级操作所产生的成本?这纯粹是资源流失,且通常难以察觉。
核心要点
2026年的企业AI成本议题,不再是训练预算或哪款前沿模型在最新基准测试中名列前茅。它关乎推理,更具体地说,是关于路由:将每个请求匹配到能够处理它且成本最低的模型,并调整决定何时增加支出的阈值。AI系统的成本由其架构决定,而非发票上列出的模型。将路由视为基础设施的核心组成部分,像衡量其他一切一样对其进行量化,这样账单就不再是谜团,而是成为一项设计决策。
作者:Akshat Agrawal是NeenOpal的生成式AI及AI/ML架构师,负责为受监管行业的企业构建并优化生产级大型语言模型(LLM)系统的成本。
