资讯动态 · 消息 · 成本与路由

LangChain 公布模型路由实验:任务成本中位数下降 64%意味着什么?

LangChain 10 月 1 日分享 973 个线程的路由实验。解读成本中位数、PR 合并率、Jev 分类器,以及把实验结果用于自身业务的限制。

RootFlowAI 内容维护团队 · 发布 · 核对

LangChain 于 2026 年 10 月 1 日 公开 Open SWE 的模型路由实验:按任务选择不同模型后,线程成本中位数相对始终使用高能力模型的对照组下降 64%,没有观察到明显的质量变化。

这个结果对控制 Agent 费用有参考价值,但它来自特定任务分布和对照条件,不能直接变成“任何业务加一个路由器都能省 64%”的结论。

实验比较了什么

官方介绍的路由器设有 fast、balanced、performance 三档,在每个线程第一条用户消息到来时选择模型,并让该模型负责整个线程。分类依据来自 Open SWE 的真实任务类型与复杂度;分类器后来使用 Jev。

第一次 A/B 测试共覆盖 973 个线程,一部分走路由,另一部分始终使用 GPT-6 Astra。官方报告,路由组成本中位数为 0.94 美元,对照组为 2.61 美元;均值下降 42%,第 90 百分位成本下降 37%。这些指标分别描述分布的不同位置,不能互相替换。

“质量没有明显变化”不等于证明完全相同

报告以线程最终产生已合并 PR 的比例作为主要成功信号:路由组为 29.2%,对照组为 27.3%,对应 p 值 0.49。PR 创建比例也接近,用户评价则比较稀疏。

这些结果没有显示出显著差异,但不构成模型效果完全相同或严格非劣性的证明。PR 合并本身也会受到任务难度、审阅与团队流程影响。对于自己的业务,应选择真正对应用户价值的指标,例如正确解决工单或完成可验收的修改。

为什么决策放在 Agent 内部

LangChain 的观点是,任务提示、工具、领域知识和成功标准都在 Agent 的执行框架中,因此这里更容易决定任务需要哪一档模型。通用网关若没有这些上下文,很难仅凭请求长度准确判断难度。

这不意味着 API 网关没有价值。鉴权、限流、供应商故障切换,与“这项工作需要多强的模型”是不同层次的问题。设计时应明确各自依据,避免把简单流量分发描述成理解任务的智能路由。

哪些问题仍未解决

该原型只在线程开始时选择一次模型,尚未解决途中任务升级和子代理统一路由。原文也提醒,切换模型可能损失已有提示缓存,需要把上下文重新读取成本算进去。

另一次以始终使用低档模型为对照的试验因用户反馈问题在一天内结束,未得到有统计意义的结果。它不能作为与第一轮同等强度的量化证据。

本文是第三方官方实验解读,并非 RootFlowAI 的实测或节省承诺。落地前应先整理真实任务集、记录当前费用和成功率,再验证分类、回退与缓存影响。

资料来源

接下来可以做什么

阅读 Jev 与生成模型的分工分析 →