
Weave Router 2.0:先花掉已经买下的订阅,再挑这一步的模型
Weave Router 2.0 在编程智能体前面做模型路由:先耗尽你已经付费的订阅席位,只在省下的钱超过重建提示缓存的成本时才切换模型。
Weave Router 是一款模型路由工具,2026 年 9 月 16 日发布 2.0 版,当天排在 Product Hunt 当日榜的第一位。1 它的位置在编程智能体和模型供应商之间:Claude Code、Codex、opencode、pi 这类工具把请求发给 Weave Router,Weave Router 给每一次请求打分,再挑一个便宜到够用、又能把这一步做完的模型。2 接进去只需要一条命令,装完之后你的工具和以前一样使用;收费按路由过的花费抽 5%,源码可以自托管,许可为 Elastic License 2.0。34
Weave Router 处理的是编程会话里数量最多的那部分请求。官方博客描述过这种会话的构成:一次会话里有上百次请求共享同一段上下文,读文件、跑测试、改一行配置各算一次,每一次都可以换一个模型。全程挂在同一个前沿模型上是最省事的做法,代价是这些小事也按最贵的单价结算;路由的用处在于把这部分请求交给便宜的模型,把前沿模型留给真正需要判断力的步骤。3
先花掉你已经买下的订阅,再比谁的单价便宜
多数模型网关回答的是同一个问题:这次请求该交给哪个模型。它们按你手上的 API key 算账,也就是按 token 付费的那部分支出。Weave Router 2.0 多看了两样东西,其中一样是订阅。它可以在同一时间持有多个供应商的订阅,按「哪份订阅这个月还有额度」来路由,并且优先把固定月费的席位用掉。官方博客把这件事写成一句话:网关在你按 token 付费的 key 之间路由,Weave Router 还会在你已经买下的固定月费席位之间路由,并先把这些席位用干。3
由此得到一个不太常见的用法:你可以让 Claude 模型跑在 Codex 里,也可以让 GPT 模型跑在 Claude Code 里。两个工具本身不用改配置,Weave Router 在它们前面当入口。4
把订阅排在第一位的意义要放到账单上看。一个团队的模型支出里并存两种资源:一种是按量计费、花一笔记一笔的额度;另一种是月初已经付掉的固定月费,用完用不完都退不回来。只优化第一种资源,得到的答案是挑单价最低的模型;把第二种也算进来,答案里多出一条——先让已经付过钱的那部分跑起来。
边界由官方自己划定。Weave Router 面向编程类工作负载,官方对比表把自己的局限写成
Coding workloads only. Not a general API gateway.,如果你的产品后端需要的是通用网关,官方指向的是别的工具。3切换本身有成本,降级要配一条回退通道
1.0 版的问题出在会话中间换模型。一次会话共享同一段上下文,供应商侧的提示缓存本来能把重复的部分按更低的价格计费;中途换模型会把这个已经热起来的缓存冲掉,整段上下文按没有命中的价格重算一遍。单价降了,这一笔可能反而更贵。3
2.0 版的做法是按供应商、按会话记住缓存状态,只有预计省下来的钱超过重建缓存的成本,才把请求移到另一个模型;官方给出的效果是长会话里少了突然出现的账单尖峰。3
决策的粒度也写得很清楚。官方语义文档把 Weave Router 能定位到的最小单位定义为一次上游 API 请求(action),每一次请求单独选模型和供应商;会话级的 session pin 只是参考状态,用来影响这一次的选择。5
把请求降下去,还要能把它升回来。2.0 加了一个升级分类器,在任务运行过程中盯着便宜模型的表现,如果便宜模型卡住、打转或者跑偏,就把这个任务升回前沿模型。官方给出的说法是,能降级的前提是还能升回来。3
新的复杂度分类器用 10 倍于 1.0 的真实编程会话训练,官方称打分在个位数毫秒内完成,不给请求增加可见延迟。这是厂商自述,官方没有公布延迟的测量方式。3
官方公布了两组对比数据。在同一套 Codex 环境、同一批任务、每个任务两次尝试的条件下,Terminal-Bench 4.0 的 66 个任务里,Weave Router 解决了 62.1%,作为对照的前沿模型 GPT-6 Astra 解决了 60.6%;单任务成本 5.22 美元对 10.03 美元,单任务耗时 20.5 分钟对 44.1 分钟。另一组 SWE-Atlas 的 124 个任务上,Weave Router 解决了 62.1%,Astra 解决了 66.1%,单任务成本 2.31 美元对 5.04 美元。同一张图上还有第三个对象 OpenRouter Auto,它代表按单次请求决策的另一类路由器,在这 66 个任务上解决了 25.0%。官方注明这一组与前两者不是同一天跑的配对结果,只作参考。
官方同时写明:质量按 pass@2 统计,两次尝试中任意一次通过即算解决;两次尝试不构成排行榜提交(Terminal-Bench 要求至少 5 次);两组百分比的 95% 置信区间有重叠;在 SWE-Atlas 上 Weave Router 比 Astra 少解决 5 个任务。3

路由决策可以查看,也可以被接管
自托管部署里有一个
POST /v1/route 端点,它只返回这次请求的路由决策;想知道「这一句为什么发给这个模型」,可以先用它看一遍,再把流量真正接上去。2每一次路由决定也能进你自己的观测栈。Weave Router 默认输出 OTLP trace,可以接到 Honeycomb、Datadog、Grafana 或自建采集器,本地还有一个查看路由结果的看板。2
数据落在哪里取决于你选哪种部署。一条命令的默认路径用的是 Weave 托管的路由器;选择自托管时,路由器、评分器、Postgres 和供应商密钥都在你自己机器上,提示词从路由器直接发给配置好的供应商,官方写明不经过 Weave。2
官网还给了一个估算器,填进当前的月度 token 花费,按现有模型池的基准给一个节省估计。官方在这块组件下标注了前提:实际节省取决于工作负载、提示词构成和供应商定价。4
两种资源,同一张账单
References
- 1Weave — Product Hunt
producthunt.com
- 2weave-os/router — GitHub
github.com
- 3
- 4
- 5Router semantics — weave-os/router
github.com
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
