Laya Skill:零Token输出的本地决策引擎,33ms极速路由
Laya:零Token输出的本地决策引擎,让AI代理不再”过度思考”
Laya 是一个开源的非自回归决策引擎,专注于对文本、邮件、工单、JSON 等结构化状态执行类型化决策——输出是选择、评分或概率,而非一个个 token。核心卖点是”零生成、无幻觉、快如闪电”:单次前向传播约 33ms,421M 参数,可完全本地运行,无需调用云端 LLM API。在 GitHub 获得约 23,002 颗星(截至 2026-09-25),今日登上 Trending 日榜,是近期增长最快的 AI 决策类开源项目之一。
功能与原则
Laya 的设计原则可以概括为”让合适的工作用合适的工具“——通用 LLM 适合写文案、做分析,但不擅长高频、窄领域的分类决策。这类工作(路由工单、判断意图、评估紧迫度)通常用 GPT-4 显得”杀鸡用牛刀”,用规则引擎又不够灵活。Laya 的解法是训练一个专用的决策头(decision head),接受一段文本输入,输出结构化的决策结果,而不是逐 token 生成答案。
核心能力:
– choice:多选项选择(部门路由、意图分类等)
– score:有序评分(紧急度、风险等级等)
– noul:是/否/概率(违规判断、退订意图等)
内置置信度输出,支持在低置信度时 fallback 到 LLM,形成”快决策层 + 慢推理层”的分层架构。
认可度
- GitHub Star:约 23,002(截至 2026-09-25),近期日增 +2,620
- License:Apache-2.0(可商业使用,无需开源修改)
- 集成覆盖:LangChain、LangGraph、MCP Server、TypeScript SDK、Nix flake、Docker
- Trending:2026-09-25 登上 GitHub Trending 日榜
链接
GitHub:https://github.com/NandhaKishorM/laya
原作者
NandhaKishor M(GitHub: NandhaKishorM),独立开发者,项目由 Convai Innovations 联合发布。团队在模型训练与决策系统上有学术积累,仓库附带完整的 RLCD 微调流程与 Kaggle 免费 GPU 训练笔记本。
介绍
Laya 的技术核心是一个基于 ModernBERT-large 微调的非自回归决策模型。与传统 LLM 的”输入 prompt → 逐 token 生成”不同,Laya 的前向传播直接输出分类结果——没有采样、没有温度、没有 token 长度的不确定性,因此延迟极低且结果可复现。
推理成本方面,421M 参数在 M1 Max GPU 上单条英文决策约 34ms,Apple GPU 上约 13ms,CPU 模式约 139ms。内存占用约 1GB,主流笔记本即可运行。首次推理会触发 CUDA kernel 编译,建议在服务启动时做一次预热调用。
项目内置三个 checkpoint:
– English(默认):覆盖英语场景,含置信度校准
– Multilingual:支持 100+ 语言,窗口 8,192 token
– Fast:轻量版,延迟更低
模型默认已对概率做校准(fitted temperature),输出置信度可以直接当作决策阈值依据,不需要额外标定。
特点
- 零 token 输出:不做语言生成,只输出决策结果,消除 LLM 生成层的幻觉风险
- 33ms 低延迟:单次前向传播,速度比任何 LLM API都快,适合高频决策场景
- 完全本地:数据不离开机器,支持 CUDA / Apple MPS / CPU 多后端
- Apache-2.0 许可:可商业集成,无需开源修改或上报权重
- MCP 原生支持:提供官方 MCP Server,直接暴露 laya_predict / laya_route / laya_status 工具
- 微调支持:附 Kaggle 笔记本,2×T4 免费 GPU 约 4 小时可微调到目标领域
使用方法
pip 安装(Python):
pip install laya
基础调用:
from laya import Router
router = Router() # 首次自动下载 checkpoint
state = "Hi, we were billed twice for March. Refund the duplicate today or we cancel."
questions = {
"department": {
"type": "choice",
"instructions": "Which team handles this?",
"criteria": {
"billing": "invoices, payments, refunds",
"technical": "bugs, outages",
"other": "everything else"
}
},
"urgency": {
"type": "score",
"instructions": "How urgent?",
"criteria": ["not urgent", "soon", "blocking"]
},
"churn_risk": {
"type": "noul",
"instructions": "Do they threaten to cancel?"
}
}
r = router.predict(state, questions)
print(r["answers"]["department"]["choice"]) # billing
print(r["answers"]["churn_risk"]["noul"]) # probability = yes
HTTP 服务模式(laya-serve):
pip install "laya[serve]"
python -m laya.serve
# POST http://localhost:8000/v1/systemone
# 兼容 TypeSafe Jev API 格式,迁移只需改 base URL
MCP Server 模式:
pip install "laya[mcp]"
# 暴露 laya_predict, laya_route, laya_preset, laya_status 四个工具
使用场景与人群
适用场景:
– 工单/客服消息的自动路由(billing / technical / other)
– 意图分类与置信度过滤(低置信度再交给 LLM 处理)
– 文本审核与合规检查(判断是否违规、是否含敏感词)
– 优先级/紧急度评分(工单、漏洞、事件分级)
– RAG 系统的检索相关性过滤
目标用户:
– 需要高频决策但不想烧 LLM API 成本的团队
– 对数据隐私有要求的场景(工单数据不上云)
– 正在构建 Agent 流水线,需要在 LLM 之前加一层快速过滤的架构师
– 对延迟敏感的实时系统
输入与输出案例
案例一:客户消息路由
Input state: "Hi, we were billed twice for March. Refund the duplicate today or we cancel."
Questions:
- department (type=choice): billing / technical / other
- urgency (type=score): not urgent / soon / blocking
- churn_risk (type=noul): Do they threaten to cancel?
Output:
department: "billing" (confidence: 0.94)
urgency: "blocking" (confidence: 0.87)
churn_risk: probability=0.91 (yes)
案例二:意图分类与置信度过滤
Input state: "I need to cancel my subscription immediately"
Questions:
- intent (type=choice): upgrade / downgrade / cancel / other
- confidence (type=noul): Is the cancellation intent clear?
Output:
intent: "cancel" (confidence: 0.96)
confidence: probability=0.98 (yes → 自动处理,无需人工审核)
低于 0.85 置信度的请求可以自动转发给 LLM 做二次确认,形成”快筛 + 精判”的分层架构。
评论区
登录后可评论。