AYi_AInotes 这条是 Akshay 那一篇 Jev 长文的中文转述——"过去三年我们把生成式大模型当成万能锤子,连最简单的单选判断也要调几毛钱的通用模型"。把要点拆开看一下。
Jev 的工程范式核心:
- 不生成长文本,专注强类型决策——输入一组确定的"输入状态 + 候选问题",输出带置信度的单选结果;
- 成本极低——输入百万 Token 4 分钱,输出完全免费;
- 延迟极低——官方测算几十毫秒;
- 格式零幻觉——不会吐出未定义选项或破损文本,schema 上完全可控。
为什么这件事对 Agent 工程重要:
传统大模型的死穴是"自回归生成"——哪怕最终答案只有一个词,也要一个字一个字吐 Token,遇到 JSON 格式错误还要重试。Agent 后台跑的成千上万次细碎判断(工单紧急吗?挑哪个模型?命令有没有危险?)用大模型既贵又慢。
Jev 把这套流程改成了纯语义决策——输入状态确定、输出确定、置信度可校准。开发者终于能写出理性防线:
- 高置信度 → 自动放行;
- 中置信度 → 唤醒大模型二次复核;
- 低置信度 → 无缝移交人工。
Agent 里的三个卡位:
- 最上游路由器:替请求分流最便宜的模型;
- 中游执行闸门:高危终端命令前一秒完成风控拦截;
- 下游质检员:监督复杂任务到底有没有真正跑通。
这套"大小脑分工"是 Akshay 这篇长文最核心的论点:以前是软件迁就大模型的自回归废话,从今天起是大模型适配工业软件的确定性分支。
几个工程化的真问题:
- 校准数据集怎么搭:Jev 的输出置信度准不准,取决于训练集分布跟业务分布对齐——同一套 Jev 在不同业务上表现天差地别;
- 边界判定要人盯:候选选项的"全集"得人定,Jev 不会自动发现遗漏的选项;
- 置信度阈值要持续调:阈值定高了"漏放过",定低了"啥都唤醒大模型",等于没省钱;
- 跟现有 LLM 链路集成:Jev 不能完全替代 LLM,最佳定位是"前置过滤器 + 后置质检器";
- 冷启动阶段:没数据时 Jev 决策质量不稳,建议先用 LLM 做几轮再切 Jev。
对国内做 Agent 的团队:
- 这类"非生成式专用模型"会是 Agent 工具链的下个热点——国内目前缺类似 Jev 的开源选项,可以考虑在 Qwen2.5 / DeepSeek 基础上自训一个分类头;
- 百毫秒级的语义决策层会变成 Agent 标配——现在拼"模型多大",下一步拼"决策多快多准";
- 不要追求"一个模型干所有事"——大模型做生成、Jev 做决策、规则引擎做兜底,三层组合才是工程现实。
一句话总结:Jev 的真正意义不是"又一个模型",是 Agent 工程范式从"自回归生成"切换到"确定性分支"的临界点——每个做 Agent 的人都该停下来想一想自己系统在哪个阶段。
26 浏览 0 评论
0 反应












