给 Agent 加一个模型路由器,直觉上很简单:容易的任务交给便宜模型,复杂任务再调用昂贵模型。但 IBM 团队最近公开的实验给出了一个反直觉结果。在同一套 Agent 和 417 个测试任务上,标价更低的 GPT-4.1 反而花掉 155 美元,Claude Sonnet 4.6 只花了 79 美元。价格表没有错,错的是把价格表当成完整成本。
与此同时,GitHub 把 AI credits 的可见性和成本中心控制放进 Copilot 企业计费界面。这两个变化放在一起看,模型路由已经不是一个小型分类器问题,而是需要工程、财务和治理共同参与的系统优化问题。
标价低,不等于一项任务更便宜
IBM 的实验使用同一个 CodeAct Agent 跑 AppWorld Test Challenge。Sonnet 虽然推理步骤约为 GPT-4.1 的三倍,但 Agent 在多轮执行中会反复使用大段上下文,缓存读取价格和命中率因此改变了最终账单。Sonnet 的有效成本约为每个任务 0.19 美元,GPT-4.1 则约为 0.37 美元。这个结果只属于该工作负载和当时的服务条件,却足以否定一种常见做法:仅根据输入、输出 token 标价预估 Agent 成本。
一次任务真正消耗的资源包括上下文重用、工具调用、重试次数、推理步数、输出长度和底层服务状态。端点是否拥塞、缓存是否温热,也会改变延迟。路由器若看不到完整执行轨迹,只能优化一个与用户体验和实际账单都不完全一致的代理指标。
路由器要看执行过程,而不是第一句话
“总结这份合同”看起来简单,实际可能触发检索、合规检查、多轮修订和工具调用;一个术语密集的问题,也可能被小型专用模型迅速解决。任务难度往往要执行后才能显现,企业环境还要同时考虑数据驻留、获批模型列表、隐私和可靠性。按提示词做一次静态分类,很难覆盖这些约束。
IBM 团队因此把路由改成成本、质量与延迟的联合优化。在其公开配置中,一个路由点实现 84% 准确率、93 美元总成本和 83 秒延迟;与始终使用 Opus 相比,成本降低 21%,延迟降低 9%,代价是准确率下降 4%。路由计算本身约耗时 6 毫秒、占用 2 KB 内存。这里最有价值的不是某个固定数字,而是团队明确展示了可选择的成本和质量前沿,而不是宣称存在一个适合所有业务的“最佳模型”。
预算必须落到团队和个人
路由算法降低了单次成本,并不代表组织知道钱花在了哪里。GitHub 新增的 Copilot AI credit pool 按成本中心已分配的许可证自动计算额度,管理员可以在额度用尽后阻断继续使用,也可以允许进入额外付费。这个 credit pool 与控制计量费用的预算是两层限制,可以同时存在。个人页面则开始显示当前计费周期实际使用的 AI credits,而不再只显示一个缺少上下文的预算百分比。
这类设计把 AI 消耗从企业总账拆到具体组织单元,但它仍然没有回答哪些消耗产生了有效工作。下一步应把 credits 与成功完成的任务、合并的代码、被接受的评审或节省的人工步骤关联起来。否则团队可能只得到更精细的 token 账单,却仍然无法比较两个工作流的投入产出。
小而专的模型需要成为可选路径
路由不应只有“便宜通用模型”和“昂贵通用模型”两个档位。Dharma AI 在自己构建的巴西葡萄牙语 OCR 基准中,报告其专用模型得分 0.925,高于 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。团队将优势归因于针对葡萄牙语的监督微调,以及用于降低输出退化的偏好优化。
这是模型开发方在自有基准上的结果,不是独立复现,采购方不应直接把分数外推到其他语言和文档类型。但它提供了一个重要反例:更新、更通用的模型不一定在特定任务上更便宜或更可靠。成熟路由器需要维护经过业务数据验证的专用路径,并在输入越界时回退,而不是永远把复杂请求升级到最大的模型。
先建立测量闭环,再自动路由
团队可以先记录每类任务的实际 token、缓存命中、工具调用、端到端延迟、成功率、重试和人工接管,再为成本中心设置明确的质量底线与额度。只有这些数据稳定后,路由器才有值得优化的目标;否则所谓智能路由只是把未经验证的价格假设自动化。
模型继续增多后,路由层会逐渐成为 AI 平台的控制面:一边连接模型、缓存和运行基础设施,一边连接预算、合规和业务结果。真正有用的指标不会是“用了多少 token”,而是团队为一次可信、成功的工作付出了多少,以及在质量下降前还有多大的成本空间。