Jev 速查卡:一个不聊天的决策模型,定义、问法、定价与边界

先说结论

  • Jev 是 TypeSafe AI 的旗舰模型,官方称其为第一个 System One 模型;它接收 state 与类型化问题,返回类型化答案和概率,官方原话明确它“不写回复、不产代码、不生成解释”。
  • 三种问题原语:choice(选一个)、score(打分)、noul(是不是),可一次调用混用;输出分别是选项+概率+confidence、分数+legend+概率+confidence、0~1 判断。
  • 定价官方口径为 $42 per billion input tokens;API 端点是 POST https://api.typesafe.ai/v1/systemone;默认模型名是 jev-latest
  • 它只吃文本,不解释理由;校准是群体层面,不保证单条正确。官网首页有“Zero Hallucinations”说法,但要结合校准边界一起看。
  • 第三方 60 例基准(社区二手)显示 Jev 在高置信桶的准确率不错,但桶分布高度集中,样本量小,不能外推成生产保证。

一、一句话定义:Jev 是一个决策模型,不是聊天模型

官方首页 把 TypeSafe AI 的路线概括为 “Not Chat”。官方概念页给的定义是:System One models make fast, structured decisions for software. Jev is TypeSafe’s flagship model and the first System One model. 翻成自己的话:System One 模型是一类面向软件内部决策的模型,Jev 是 TypeSafe 的旗舰、也是官方所称第一个 System One 模型。

它与 LLM 最关键的区别,官方原文是:

System One models do not write replies, produce code, or generate explanations of their reasoning.

也就是说,它没有生成自然语言文本的输出能力。你定义好可能答案,它从答案空间里返回类型化结果。官方首页用三句话概括输出特性:Decisions, Not Strings;Calibrated Confidence;More Like Code。这是官方口径,不是我的判断。

发布方 TypeSafe AI 的团队页显示,CEO 是 Diogo Almeida,COO 是 Sasha Sheng,CTO 是 Erik Gafni。这是官方团队页信息。上线日期方面,官网首页没有明确上线日期;第三方基准报告 webofmike 写到 TypeSafe AI launched Jev on 2026-09-15,这属于社区二手,不是官方公告。

二、关键事实速查卡

项目 内容 标注
发布方 TypeSafe AI 官方数据
模型 Jev,默认模型名 jev-latest 官方数据
类别 System One 模型 官方数据
API 端点 POST https://api.typesafe.ai/v1/systemone 官方数据
输入 文本:字符串、JSON 对象、文本数组;图片/音频/视频不支持 官方数据
输出 类型化答案 + 概率 + confidence 官方数据
定价 $42 per billion input tokens 官方数据
入口 Playground / API keys / SDK / agent skill / llms.txt 官方数据
上线日期 2026-09-15 社区二手
具体版本 响应返回具体版本;示例 jev-1.13.0 未在本轮材料中核实 未能核实

这里需要说明:jev-latest 不是我在猜,官方 System One 概念页写道 “The examples in these docs use jev-latest, which is also the SDK default.” 而 API 端点来自 quickstart。定价来自官网首页。

我按 1 billion = 1000 million 做单位换算:$42 / 1000 = $0.042,因此 per million input tokens 相当于 $0.042。这是自己推算,不是官方直接给出的 per million 价格。第三方报告也按 $0.042/MTok 计算,属于社区二手口径。

三、三种问法:choice / score / noul

官方 Primitives 把问题类型称为 primitives。三种原语可以用一个代码块快速记:

type    问的什么          返回
choice  选一个             choice + probabilities + confidence
score   打到什么程度       score + legend + probabilities + confidence
noul    是不是             noul(0~1)

这里不是原文照抄,而是我对官方文档返回字段的浓缩。需要注意 Score 的 legend 是用来解释分数对应哪个档位的;Noul 只返回 0 到 1 之间的数值,用来表示是/否的倾向。

官方 quickstart 里有 Python SDK 用法,能展示混合调用。我贴上这个命令/配置片段,便于快速理解:

from typesafe_sdk import Choice, Noul, Score, TypeSafeClient

client = TypeSafeClient()
response = client.system_one(
    state=ticket,
    questions={
        "department": Choice(
            instructions="Which team should handle this",
            criteria={
                "billing": "Payment or subscription issues",
                "technical": "Bugs or integration problems",
                "sales": "Pricing or account questions",
            },
        ),
        "frustration": Score(
            instructions="How frustrated the customer appears",
            criteria=[
                "Calm, just stating facts",
                "Frustrated but civil",
                "Very angry, strong language",
            ],
        ),
        "is_urgent": Noul(
            instructions="The message conveys urgency or time-sensitivity",
        ),
    },
)

这个片段来自 官方 quickstart,它演示了一个 state 下同时问 department、frustration、is_urgent 三个问题。官方说每个问题看到同一个 state、独立评估,返回结果按你定义的 ID 对齐。你自己可以用代码把这些答案组合成工作流,而不是让模型生成一段分析。

四、定价、入口与版本

官网首页给出的价格是 Jev.Cost $42 per billion input tokens,并标注 “238x lower input price than Claude Fable 5.1”。这是官方营销数据;我把它标为官方数据,但比较口径没有在首页展开。

第三方基准报告按 $0.042/MTok 计算,这与官方 $42 per billion input tokens 一致,但这是社区二手里出现的口径,不是官方单独给出的单位价格。它测算 60 例平均输入 413 tokens,单次成本约 $0.0000173,这属于社区二手数据。

入口方面,官方 quickstart 给了几条路径:

  • Playground:https://console.typesafe.ai/playground
  • API key:https://console.typesafe.ai/keys
  • HTTP API:POST https://api.typesafe.ai/v1/systemone
  • SDK:pip install typesafe-sdkuv add typesafe-sdk
  • Agent skill:可用 claude plugin marketplace add typesafe-ai/skillsnpx skills add typesafe-ai/skills --skill typesafe-ai 安装
  • 文档索引:https://docs.typesafe.ai/llms.txt

版本上,默认模型名 jev-latest。第三方基准里还出现了 jev-preview,这是报告自己用的模型名,不是官方文档给出的默认项。因此如果你要复现,默认应当以 jev-latest 为准。

五、边界与校准:不要当它是百发百中

官方 System One 概念页有一段很关键的边界表述:

Calibration is measured across groups of predictions; it does not guarantee that an individual answer is correct.

意思是校准是群体层面的,单条预测不保证正确。官网首页虽然写了 “Zero Hallucinations”,但这是官方营销口径。更准确的理解应该是:Jev 的输出空间被原语约束,不像 LLM 会自由生成,所以不容易出现“编一段回复”式的幻觉;但判断本身仍可能错。两种说法要一起看。

另外,官方明确说 Jev 目前只接受文本输入,图片、音频、视频都不支持;它不生成解释、不生成代码、不写回复。若要拿到可用结果,你需要把任务拆成小判断。官方 Primitives 页面建议每个问题只做一个“有上下文的人一秒内能做出的快判断”,而不是“分析并决定最佳行动”这种慢推理。后者应该拆成多个小问题,用代码组合。

第三方基准 webofmike 的 60 例 agent tool-call risk 测试结果是社区二手,我这里单独标注:jev-latest 和 jev-preview 准确率都是 91.7%;清晰样本 100%,模糊样本 71.4%,对抗样本 91.7%;ECE 分别为 0.0712 和 0.0505。这个结果看起来不错,但报告自己也提醒:高置信桶(0.9–1.0)占了 50/60,ECE 主要由这一桶决定,n=60 太小,不能当作完善证据。同时,所有错误都发生在 confidence < 1.000 的预测中,这是报告最有价值的观察,但仍是社区二手数据,我没有复现。

自己的判断:什么时候可以考虑用 Jev

  • 适合:已知选项选一、程度打分、是非判断,且下游用代码自动化执行。比如工单路由、风险分类、情绪等级、是否要求退款、是否包含敏感信息。
  • 不适合:需要解释、需要长文本、需要开放问答、需要代码生成、需要图像/音频/视频理解。
  • 如果要用 confidence 做自动升级,不要只迷信单次分数。建议先在自有数据集上分桶统计历史准确率,设定阈值,并在代码里写死升级路径。
  • 定价直接看 $42 per billion input tokens 会显得便宜,但官方没有在首页单独列出输出 token 计费方式;预算时要保守。
  • 默认 jev-latest 适合试用,生产环境应固定具体版本,方便复现和回滚。

这次没核实的

  • 官方 API 响应中返回的具体版本示例 jev-1.13.0:工单列为官方示例,但我在本批来源正文中未能定位到该字符串,暂不作为已核实事实。
  • 独立定价页 /pricing 是否真的返回 404:工单补充,但我未直接抓取该路径验证。
  • 输出 token 定价、速率限制、区域可用性、SLA、数据保留政策:未能核实。
  • 官网首页所比较的 “Claude Fable 5.1” 是什么口径:未能核实。
  • 第三方基准的准确率、ECE、延迟、成本均为社区二手,未复现。
  • quickstart 中出现的 GitHub 技能链接,可访问性未独立验证。

参考来源

评论区

0 条评论

登录后可评论。

拾光机 73 阅读