资讯动态 · 消息 · 模型与 Agent
Jev 是什么?TypeSafe AI 发布面向软件自动化的决策模型
了解 Jev 的结构化决策、API、官方定价与中文使用限制,区分类型安全和判断正确性。
RootFlowAI 内容维护团队 · 发布 · 核对
TypeSafe AI 在 2026 年 9 月 15 日宣布推出 Jev,并开放早期访问。官方把这类模型称为 System One Models:开发者提交业务状态和预先定义的问题,模型返回软件能够直接处理的决策结果。
Jev 值得 AI 应用开发者关注的地方,是它把分类、评分、分流等高频判断作为主要任务。例如,客服系统收到一句投诉后,可以先判断问题类型和紧急程度,再由程序选择处理流程;只有需要生成解释或展开复杂推理时,才调用相应的生成模型。
Jev 如何返回决策?
官方文档介绍了三种问题类型:
| 类型 | 用途 | 返回信息 |
|---|---|---|
| Choice | 从预定义选项中选择 | 选择结果、概率分布、置信度 |
| Score | 按给定标准评分 | 分数、概率分布、置信度 |
| Noul | 判断一项陈述 | 0–1 的判断值;没有独立的 confidence 字段 |
多个问题可以放进同一次请求,针对同一份状态并行、独立地求值。开发者再用代码组合结果,例如把“问题类别”“紧急程度”“信息是否充分”组合成分流规则。
这也意味着,问题之间的依赖关系需要由应用管理。如果第二个判断必须使用第一个判断的结果,就不能仅靠把它们塞进同一请求来表达先后关系。
API、价格和输入限制
截至核查日期,官方模型文档列出的版本是 jev-1.13.0,请求端点为 POST /v1/systemone。官方同时提供 Python 和 JavaScript SDK 文档。
官方标价为每百万输入 Token 0.042 美元,输出不另计 Token 费用。这是 TypeSafe 的公开价格,实际接入资格、计费和限额应以官方账户信息为准。
模型目前只接受文本,可用字符串、JSON 对象或文本数组组织输入。图像、音频、视频需要先转成文本或结构化信息。不能因为游戏演示中有画面,就推断 Jev 本身可以直接识别截图。
文档给出的总请求上限为 64k Token,同时要求 state 加最长单个问题不超过 32k Token。中文业务还要特别留意:官方说明英语是主要训练语言,其他语言可以处理,但效果并不相同,中文场景需要自己的样本验证。
如何理解“更快、更便宜”?
发布公告给出了 70–500 毫秒的端到端响应时间,并展示部分工作流中的大幅提速和成本优势。这些数字来自厂商测试,不能直接理解为任何任务都能获得同样收益。
官方也说明了测试条件:延迟评测通常从美国西海岸发起;部分演示输入较短,有利于突出并行输出的优势;工作流由内部团队设计,比较方式和对照模型配置都会影响结果。
开发者评估时,应固定同一份业务数据和成功标准,同时记录准确率、P95 延迟、失败率、回退到其他模型的比例和总成本。单次请求便宜,如果频繁需要重试或人工复核,整条流程未必更省。
本文未进行 Jev API 实测,不把官方展示当作本站测试结果。
“零幻觉”是否代表不会判断错误?
需要把输出格式和判断质量分开理解。官方强调的类型安全,是输出遵守预定义结构和选项;即使返回了一个合法选项,也可能选错。
置信度同样不能直接当作现实正确率。官方文档说明,Choice 和 Score 的 confidence 是从返回的概率分布计算得到的统计量。应用应该用自己的验证集选择阈值,并给不确定或高风险决策保留复核与回退路径。
例如,模型可以把工单归到“退款”,但是否退款、退多少、有没有重复操作,仍应由业务规则、权限检查和执行系统决定。
哪些开发者值得关注?
Jev 适合列入以下场景的候选评估:客服意图分流、Agent 工具候选选择、内容评分、工作流分支判断。最容易开始的方式,是挑选一个边界明确、已有真实样本和人工判定标准的环节做对照。
接入时也需要适配它的状态与问题结构。官方公布的 /v1/systemone 接口与常见聊天请求格式不同,不能假定只替换现有 SDK 的 Base URL 就能直接使用。
对于 RootFlowAI 读者,这项变化提供了一个新的架构思路:把高频判断拆成明确任务,在保留质量验证的前提下,为不同环节选择合适的模型。RootFlowAI 是否接入 Jev 尚未核实,本文不构成本站可用性公告。
关于怎样安排决策、生成和回退,可继续阅读 Jev 与生成模型如何分工。