Jev模型是什么?TypeSafe AI 的结构化决策模型
|本文介绍 Jev 的模型定位、输出类型、接入方式和官方评测口径。
TypeSafe AI 的发布文章和官方文档是本文的主要资料来源。
一、Jev模型是什么?
TypeSafe AI 在 2026 年 9 月 15 日发布了 Jev,并开放 early access。Jev 是 TypeSafe 第一个 System One Model,面向的是软件流程里的结构化判断。
它接收一份 state,也就是要判断的文本、JSON 对象或文本数组,再接收一组提前定义好的 questions。返回结果不是一段回答,而是带有固定类型的答案,以及相应的概率信息。代码可以直接读取这些结果,再决定下一步动作。
二、Jev模型如何回答问题
Jev 目前提供三种问题类型。它们对应的不是三种聊天模式,而是三种可以放进代码里的判断结果。
- Choice:从预先给出的选项中选择一个,例如把工单分到 billing、technical 或 account。返回选中的选项、所有选项的概率分布和 confidence。
- Score:按照有顺序的等级进行评分,例如把客户情绪分为平静、沮丧、非常生气。返回的 score 是各等级概率加权后的结果,因此可能落在两个等级之间。
- Noul:回答一个是或否的问题,例如“这条消息是否在申请退款”。返回 0 到 1 之间的数,表示“是”的概率。Noul 不单独返回 confidence。
同一个请求可以混合三种问题。每个问题都针对同一份 state 独立判断,并在同一请求中并行评估。一个客户工单可以同时询问是否申请退款、应该由哪个团队处理,以及客户的情绪等级。
三、Jev模型能做什么
TypeSafe 将 System One Model 放在 AI 工作流和软件分支判断中,给出的方向包括分类、路由、评分、提取、条件分支、验证和实时应用。
以退款工单为例,程序可以把客户消息、订单记录和退款政策放进 state,再让 Jev 分别判断:
- 客户是否明确提出退款;
- 订单是否存在重复扣款;
- 当前政策是否支持退款。
之后由代码合并这些结果,自动处理满足条件的请求,把低置信度或规则冲突的情况交给人工,或者交给更擅长长文本推理的模型。
TypeSafe 还展示过 Doom 和 Wikiracing 等演示,用来说明结构化状态、实时判断和高基数选择的用法。Doom 演示使用的是文本和结构化游戏状态,不是图像输入。
如果一个判断过于宽泛,官方文档建议把它拆成多个较小的问题,再由代码组合。例如,不直接问“这个工单应该如何处理”,而是分别判断严重程度、客户情绪和信息完整度,并在代码中设置权重。
四、它和主流大模型有什么区别
主流大模型通常以生成文本为主要接口。它们也可以通过 JSON Schema、JSON Mode 或 Function Calling 输出结构化结果,但应用仍然需要设计提示词、解析结果并处理格式或内容不符合预期的情况。
Jev 从接口层就把可返回的结果限制在 Choice、Score 和 Noul 这几类类型中。选项、等级和问题都由调用方提前定义,返回值不会变成一段需要再次解析的说明文字。它还为 Choice 和 Score 提供概率分布与 confidence,便于代码设置自动处理和升级人工的边界。
这种设计也意味着 Jev 不负责开放式聊天、长篇写作、代码生成或推理过程说明。它更像是工作流里的一个判断函数:代码安排流程,Jev 对给定的 state 做语义判断,其他模型继续承担需要生成文字或展开推理的任务。
固定类型只能保证结果符合接口约束,不能保证每个语义判断都正确。TypeSafe 的文档也说明,概率校准反映的是一组预测的整体表现,不等于单个答案一定正确。
五、怎么把Jev模型放进现在的工作流
接入时可以按照下面的顺序组织:
- 准备 state:把消息、业务记录、相关政策和应用状态整理成字符串、JSON 对象或文本数组。需要判断的事实放进 state,不要把业务流程藏在问题描述里。
- 拆分 questions:每个问题只负责一个可以单独判断的因素,并为 Choice 和 Score 写清楚选项或等级的含义。
- 一次发送多个问题:同一份 state 需要的判断可以放在一个请求中。Jev 会并行处理,代码再读取自己真正需要的答案。
- 在代码中组合结果:用概率、confidence、阈值和业务规则决定自动处理、继续调用,还是转人工。
一个常见的流程是:用户消息进入系统后,代码先整理上下文;Jev 负责判断分类、风险或优先级;代码根据结果选择工具和分支;需要生成回复时,再调用通用大模型;最终由代码完成校验和落库。
这里的自动执行不是 Jev 自己完成的。Jev 只返回判断结果,调用工具、修改数据库、发送消息等动作仍然由外围代码或工作流引擎负责。
六、Jev模型怎么调用
官方 HTTP API 的入口是:
POST https://api.typesafe.ai/v1/systemone
Authorization: Bearer <API_KEY>
Content-Type: application/json
一个同时包含三种问题类型的请求如下:
{
"state": {
"message": "I was charged twice for order A-104. Please refund the duplicate.",
"policy": "Duplicate charges are eligible for a refund.",
"order": {"charges": [49, 49]}
},
"model": "jev-latest",
"questions": {
"refund_requested": {
"type": "noul",
"instructions": "Does the message request a refund?"
},
"department": {
"type": "choice",
"instructions": "Which team should handle this request?",
"criteria": {
"billing": "Payments, invoices, and refunds",
"technical": "Bugs and integrations",
"account": "Account access and profile issues"
}
},
"frustration": {
"type": "score",
"instructions": "How frustrated is the customer?",
"criteria": ["Calm", "Frustrated", "Very angry"]
}
}
}
返回结果会沿用 questions 中的 ID。下面的数值只是响应格式示例:
{
"model": "jev-1.13.0",
"answers": {
"refund_requested": {
"type": "noul",
"noul": 0.96
},
"department": {
"type": "choice",
"choice": "billing",
"probabilities": {
"billing": 0.91,
"technical": 0.05,
"account": 0.04
},
"confidence": 0.88
},
"frustration": {
"type": "score",
"score": 1.2,
"legend": ["Calm", "Frustrated", "Very angry"],
"probabilities": [0.1, 0.7, 0.2],
"confidence": 0.71
}
},
"usage": {"input_tokens": 180, "output_tokens": 0}
}
也可以使用 TypeSafe 提供的 Python 或 JavaScript 客户端 SDK。官方文档示例使用 jev-latest;当前模型页面列出 Jev 1.13,对应版本 ID 为 jev-1.13.0。别名会随着新版本移动,如果需要固定结果,可以直接使用版本 ID,并在响应中记录实际返回的 model。
七、官方评测数据应该怎样理解
TypeSafe 发布文章中给出的 Jev 端到端响应时间是 70 到 500 毫秒。官网还展示过“193.6x Faster”和“444.6x Cheaper”。这些是 TypeSafe 的官方数据,其中后两项来自特定的 Workflow Evals。
这组评测不是把模型单独放进一个通用问答题里,而是把任务拆成多个问题和代码规则,让不同模型在同一套结构化工作流中运行。评测页面说明,参考结果来自 GPT-6 Astra 和 Claude Fable 5.1 等模型的平均结果,工作流由 TypeSafe 团队设计。用于对比的 LLM 也通过 TypeSafe 的 System One wrapper 输出兼容的结构化决策。
因此,这些数字应当理解为 TypeSafe 在特定工作流和测试条件下公布的结果,不能直接当成 Jev 在所有任务中都比主流模型快几百倍、便宜几百倍的通用结论。实际耗时和成本还会受到输入长度、问题数量、网络和调用方式影响。
八、当前限制
- Jev 返回结构化判断,不提供开放式文本回答、代码和推理说明。
- 当前只接受文本输入,包括字符串、JSON 对象和文本数组;不支持图像、音频和视频。
- 官方文档说明英语是主要训练语言。中文等 CJK 文本可以输入,但准确度可能不相同,需要用自己的数据测试。
- 模型页面当前列出的上下文长度是每个请求 64k tokens,state 加上最长单个问题为 32k tokens;速率限制为每秒 250,000 tokens、每分钟 1,200 次请求,但官方说明这些限制会动态调整。
- 概率和 confidence 适合用来设置升级边界,但不是单个答案正确的保证。
Jev 模型把 AI 放进了软件流程中的判断位置:代码安排流程,Jev 处理语义判断,其他模型继续承担文字生成和开放式推理。