Jev 速查卡:一个不聊天的决策模型,定义、问法、定价与边界
先说结论
- Jev 是 TypeSafe AI 的旗舰模型,官方称其为第一个 System One 模型;它接收 state 与类型化问题,返回类型化答案和概率,官方原话明确它“不写回复、不产代码、不生成解释”。
- 三种问题原语:choice(选一个)、score(打分)、noul(是不是),可一次调用混用;输出分别是选项+概率+confidence、分数+legend+概率+confidence、0~1 判断。
- 定价官方口径为 $42 per billion input tokens;API 端点是
POST https://api.typesafe.ai/v1/systemone;默认模型名是jev-latest。 - 它只吃文本,不解释理由;校准是群体层面,不保证单条正确。官网首页有“Zero Hallucinations”说法,但要结合校准边界一起看。
- 第三方 60 例基准(社区二手)显示 Jev 在高置信桶的准确率不错,但桶分布高度集中,样本量小,不能外推成生产保证。
一、一句话定义:Jev 是一个决策模型,不是聊天模型
官方首页 把 TypeSafe AI 的路线概括为 “Not Chat”。官方概念页给的定义是:System One models make fast, structured decisions for software. Jev is TypeSafe’s flagship model and the first System One model. 翻成自己的话:System One 模型是一类面向软件内部决策的模型,Jev 是 TypeSafe 的旗舰、也是官方所称第一个 System One 模型。
它与 LLM 最关键的区别,官方原文是:
System One models do not write replies, produce code, or generate explanations of their reasoning.
也就是说,它没有生成自然语言文本的输出能力。你定义好可能答案,它从答案空间里返回类型化结果。官方首页用三句话概括输出特性:Decisions, Not Strings;Calibrated Confidence;More Like Code。这是官方口径,不是我的判断。
发布方 TypeSafe AI 的团队页显示,CEO 是 Diogo Almeida,COO 是 Sasha Sheng,CTO 是 Erik Gafni。这是官方团队页信息。上线日期方面,官网首页没有明确上线日期;第三方基准报告 webofmike 写到 TypeSafe AI launched Jev on 2026-09-15,这属于社区二手,不是官方公告。
二、关键事实速查卡
| 项目 | 内容 | 标注 |
|---|---|---|
| 发布方 | TypeSafe AI | 官方数据 |
| 模型 | Jev,默认模型名 jev-latest |
官方数据 |
| 类别 | System One 模型 | 官方数据 |
| API 端点 | POST https://api.typesafe.ai/v1/systemone |
官方数据 |
| 输入 | 文本:字符串、JSON 对象、文本数组;图片/音频/视频不支持 | 官方数据 |
| 输出 | 类型化答案 + 概率 + confidence | 官方数据 |
| 定价 | $42 per billion input tokens |
官方数据 |
| 入口 | Playground / API keys / SDK / agent skill / llms.txt | 官方数据 |
| 上线日期 | 2026-09-15 | 社区二手 |
| 具体版本 | 响应返回具体版本;示例 jev-1.13.0 未在本轮材料中核实 |
未能核实 |
这里需要说明:jev-latest 不是我在猜,官方 System One 概念页写道 “The examples in these docs use jev-latest, which is also the SDK default.” 而 API 端点来自 quickstart。定价来自官网首页。
我按 1 billion = 1000 million 做单位换算:$42 / 1000 = $0.042,因此 per million input tokens 相当于 $0.042。这是自己推算,不是官方直接给出的 per million 价格。第三方报告也按 $0.042/MTok 计算,属于社区二手口径。
三、三种问法:choice / score / noul
官方 Primitives 把问题类型称为 primitives。三种原语可以用一个代码块快速记:
type 问的什么 返回
choice 选一个 choice + probabilities + confidence
score 打到什么程度 score + legend + probabilities + confidence
noul 是不是 noul(0~1)
这里不是原文照抄,而是我对官方文档返回字段的浓缩。需要注意 Score 的 legend 是用来解释分数对应哪个档位的;Noul 只返回 0 到 1 之间的数值,用来表示是/否的倾向。
官方 quickstart 里有 Python SDK 用法,能展示混合调用。我贴上这个命令/配置片段,便于快速理解:
from typesafe_sdk import Choice, Noul, Score, TypeSafeClient
client = TypeSafeClient()
response = client.system_one(
state=ticket,
questions={
"department": Choice(
instructions="Which team should handle this",
criteria={
"billing": "Payment or subscription issues",
"technical": "Bugs or integration problems",
"sales": "Pricing or account questions",
},
),
"frustration": Score(
instructions="How frustrated the customer appears",
criteria=[
"Calm, just stating facts",
"Frustrated but civil",
"Very angry, strong language",
],
),
"is_urgent": Noul(
instructions="The message conveys urgency or time-sensitivity",
),
},
)
这个片段来自 官方 quickstart,它演示了一个 state 下同时问 department、frustration、is_urgent 三个问题。官方说每个问题看到同一个 state、独立评估,返回结果按你定义的 ID 对齐。你自己可以用代码把这些答案组合成工作流,而不是让模型生成一段分析。
四、定价、入口与版本
官网首页给出的价格是 Jev.Cost $42 per billion input tokens,并标注 “238x lower input price than Claude Fable 5.1”。这是官方营销数据;我把它标为官方数据,但比较口径没有在首页展开。
第三方基准报告按 $0.042/MTok 计算,这与官方 $42 per billion input tokens 一致,但这是社区二手里出现的口径,不是官方单独给出的单位价格。它测算 60 例平均输入 413 tokens,单次成本约 $0.0000173,这属于社区二手数据。
入口方面,官方 quickstart 给了几条路径:
- Playground:
https://console.typesafe.ai/playground - API key:
https://console.typesafe.ai/keys - HTTP API:
POST https://api.typesafe.ai/v1/systemone - SDK:
pip install typesafe-sdk或uv add typesafe-sdk - Agent skill:可用
claude plugin marketplace add typesafe-ai/skills或npx skills add typesafe-ai/skills --skill typesafe-ai安装 - 文档索引:
https://docs.typesafe.ai/llms.txt
版本上,默认模型名 jev-latest。第三方基准里还出现了 jev-preview,这是报告自己用的模型名,不是官方文档给出的默认项。因此如果你要复现,默认应当以 jev-latest 为准。
五、边界与校准:不要当它是百发百中
官方 System One 概念页有一段很关键的边界表述:
Calibration is measured across groups of predictions; it does not guarantee that an individual answer is correct.
意思是校准是群体层面的,单条预测不保证正确。官网首页虽然写了 “Zero Hallucinations”,但这是官方营销口径。更准确的理解应该是:Jev 的输出空间被原语约束,不像 LLM 会自由生成,所以不容易出现“编一段回复”式的幻觉;但判断本身仍可能错。两种说法要一起看。
另外,官方明确说 Jev 目前只接受文本输入,图片、音频、视频都不支持;它不生成解释、不生成代码、不写回复。若要拿到可用结果,你需要把任务拆成小判断。官方 Primitives 页面建议每个问题只做一个“有上下文的人一秒内能做出的快判断”,而不是“分析并决定最佳行动”这种慢推理。后者应该拆成多个小问题,用代码组合。
第三方基准 webofmike 的 60 例 agent tool-call risk 测试结果是社区二手,我这里单独标注:jev-latest 和 jev-preview 准确率都是 91.7%;清晰样本 100%,模糊样本 71.4%,对抗样本 91.7%;ECE 分别为 0.0712 和 0.0505。这个结果看起来不错,但报告自己也提醒:高置信桶(0.9–1.0)占了 50/60,ECE 主要由这一桶决定,n=60 太小,不能当作完善证据。同时,所有错误都发生在 confidence < 1.000 的预测中,这是报告最有价值的观察,但仍是社区二手数据,我没有复现。
自己的判断:什么时候可以考虑用 Jev
- 适合:已知选项选一、程度打分、是非判断,且下游用代码自动化执行。比如工单路由、风险分类、情绪等级、是否要求退款、是否包含敏感信息。
- 不适合:需要解释、需要长文本、需要开放问答、需要代码生成、需要图像/音频/视频理解。
- 如果要用 confidence 做自动升级,不要只迷信单次分数。建议先在自有数据集上分桶统计历史准确率,设定阈值,并在代码里写死升级路径。
- 定价直接看 $42 per billion input tokens 会显得便宜,但官方没有在首页单独列出输出 token 计费方式;预算时要保守。
- 默认
jev-latest适合试用,生产环境应固定具体版本,方便复现和回滚。
这次没核实的
- 官方 API 响应中返回的具体版本示例
jev-1.13.0:工单列为官方示例,但我在本批来源正文中未能定位到该字符串,暂不作为已核实事实。 - 独立定价页
/pricing是否真的返回 404:工单补充,但我未直接抓取该路径验证。 - 输出 token 定价、速率限制、区域可用性、SLA、数据保留政策:未能核实。
- 官网首页所比较的 “Claude Fable 5.1” 是什么口径:未能核实。
- 第三方基准的准确率、ECE、延迟、成本均为社区二手,未复现。
- quickstart 中出现的 GitHub 技能链接,可访问性未独立验证。
参考来源
- 官方首页(一手,定价与口径)
- 官方 System One 概念页(一手)
- 官方 Primitives(一手)
- 官方 Quick start(一手)
- 官方团队页(一手)
- 第三方基准报告(社区二手,非官方)
- 官方文档索引 llms.txt(一手,辅助入口)
评论区
登录后可评论。