循环里的判断题换了价码:Jev 上线一周,当闸门也当判官

循环里的判断题换了价码:Jev 上线一周,当闸门也当判官

一个不写字的模型,上线七天,先被拿去当 Agent 的工具闸门,又被放到评测席上当判官。

0:00 / 7:44
9 月 15 日,TypeSafe AI 发布了它的第一个 System One 模型 Jev:不生成文本,输入一段状态和一组带类型的提问,返回类型化的答案加概率。1 一周之内,这个东西同时进了两个位置——Agent 循环里的工具闸门,和评测席上的判官。23
本期覆盖 9 月 15 日到 9 月 21 日这一周里公开的原始材料:厂商发布说明与模型文档、集成方的开源中间件与实验数据,以及一篇跟进报道。

本期听什么

  • 它要解决的是循环里的判断成本。 语言模型生成一段文本,代码再解析成值;这个模型直接返回带类型的答案和概率,输入每百万 token 四十二美分、输出不计费,官方给的端到端延迟是七十到五百毫秒。1
  • 它落到循环里的三个位置:模型路由(这次请求交给便宜还是贵的模型)、工具闸门(这次工具调用能不能执行)、评测席(给线上流量打分)。前两个已经写进开源中间件,且失败策略相反:路由失败放行,闸门失败关闭。34
  • 它的错误是可预期的:读字面意思、不做算术与计数、日期当文本、状态越大越杂越不准、结构不变式不保证、选项顺序会影响答案。56
  • 对抗输入能移动它的答案:官方文档写明状态默认不被当作敌意输入;Pydantic 提醒选项顺序参与判断、别名会随版本漂移。56
  • 判官席上的一致性与成本:一次五个请求的对照实验里,它的判定与人工标注完全一致,方差比大模型判官低 92–913 倍,同一批判断花 0.34 美元、单次平均 0.44 秒,换 Claude Sonnet 4.6 是 28.17 美元。2

一个不写字的模型,为什么值一次调用

Jev 不是小一号的语言模型。语言模型逐字生成,产出的一段文本还要由代码解析、校验,才变成程序能用的值;Jev 放弃字符串生成,直接返回类型化结果:是非题返回「是」的概率,选择题返回每个选项的概率,打分题返回落在刻度上的位置。同一段状态上的多个问题在一次请求里并行算完,加一个问题的边际成本很低。它训练方式由厂商称为「面向校准决策的强化学习」,官方强调它不会产生类型错误——能返回什么、结构是什么,事先定义好。1
采用速度是这一周里最硬的市场信号。Vercel 的 AI 网关称它是历史上被采用最快的模型:上线二十四小时内,将近 13% 的付费团队在用,用量是 GPT-5.6 家族的两倍、是另一个近期模型的六倍多;厂商创始人 Diogo Almeida 说等待名单上的 14 万人在三十六小时内放完,到 9 月 20 日晚取消等待名单。三天之内,Cloudflare、LangChain 与 Langfuse 都完成了接入。78

它落在循环里的三个位置

模型路由挑出这次运行该用哪个模型,判完整个运行都用那一个;技能选择挑出这次请求该加载哪些技能;工具闸门在调用真正执行之前问一次风险与授权。9 这套中间件里两个工程细节值得抄:路由与技能选择失败放行(分类服务不可用不能卡死 Agent),工具闸门失败关闭(分类出错就不执行);日志只记错误类型、HTTP 状态与请求编号,因为校验类报错可能回显一部分被分类的状态。4
9 月 21 日,它同时成为评测席上的一种判官,可以在 LangSmith 里给线上真实流量打分,每个问题落成一个反馈字段。2

官方自己列出的失败模式

厂商的模型文档把不适合交给它的判断列成了一张表:按字面读提问、算术与计数不可靠、日期按文本读、指令里有间接层次会掉准确率、状态里无关内容越多准确率越低(官方称之为上下文腐化)、结构不变式不保证——同一个问题问成是非题与选择题,两个概率对不上,问成正反两遍,正反概率之和可以超过 1——以及选项顺序参与判断。落地的做法都很朴素:算术、计数、日期先后留在代码里,送进去之前先过滤状态。5
安全上,官方文档写明状态默认不作敌意输入处理,一段刻意引导的文本——注入指令、误导性框架、或者为自己分类辩解的论证——都能移动答案。5 Pydantic 的集成文档补充了两条操作性的提醒:Literal 或枚举选项的顺序是它看到的输入的一部分,调换顺序可能移动答案;别名 jev-latest 会随厂商发版漂移,调好的阈值必须钉在具体版本上。6

判官席上的一致性与成本

LangChain 的一次对照实验用五个天气请求、每个重复一百次来比:Jev 的是非判定与人工标注在 500 次里完全一致,质量分的单案方差为 0.0000149,比 GPT-5.6 Luna 低 433 倍、比 Terra 低 913 倍、比 Claude Sonnet 4.6 低 92 倍;成本 0.00035 美元一次,同一批判断花 0.34 美元,而 Claude Sonnet 4.6 是 28.17 美元;延迟平均 0.44 秒。论文作者给出的结论指标是「准确率乘以可重复性」,并强调方差低本身不等于判得对。2
同一篇报道还指出了值得注意的一点:LangChain 采用的写法是把工具输出排除在分类器输入之外,这样 Agent 抓回来的内容无法给它自己的执行签发许可。8

边界

价格、延迟与加速倍数基本都是厂商自己的口径,第三方验证目前只有 Vercel 的采用数据;判官实验只有一个 Agent、五个请求,实验方自己说结论需要更多场景;工具闸门所在的中间件仍标着实验状态。另外,集成文档提示送去做评测的内容可能被服务商留存(目前没有零数据保留),并且不要把密钥放进工具入参或会话状态。257
本期基于 2026 年 9 月 15 日至 9 月 21 日公开的一手材料:TypeSafe AI 的发布说明与模型文档、Pydantic 与 LangChain 的集成文档及开源中间件、Vercel 的采用数据,以及 VentureBeat 9 月 21 日的跟进报道(其中的对抗输入演示来自单个集成测试,不是基准)。覆盖窗口为 9 月 15 日至 9 月 21 日。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content