Laya Skill:零Token输出的本地决策引擎,33ms极速路由

Laya:零Token输出的本地决策引擎,让AI代理不再”过度思考”

Laya 是一个开源的非自回归决策引擎,专注于对文本、邮件、工单、JSON 等结构化状态执行类型化决策——输出是选择、评分或概率,而非一个个 token。核心卖点是”零生成、无幻觉、快如闪电”:单次前向传播约 33ms,421M 参数,可完全本地运行,无需调用云端 LLM API。在 GitHub 获得约 23,002 颗星(截至 2026-09-25),今日登上 Trending 日榜,是近期增长最快的 AI 决策类开源项目之一。

功能与原则

Laya 的设计原则可以概括为”让合适的工作用合适的工具“——通用 LLM 适合写文案、做分析,但不擅长高频、窄领域的分类决策。这类工作(路由工单、判断意图、评估紧迫度)通常用 GPT-4 显得”杀鸡用牛刀”,用规则引擎又不够灵活。Laya 的解法是训练一个专用的决策头(decision head),接受一段文本输入,输出结构化的决策结果,而不是逐 token 生成答案。

核心能力:
– choice:多选项选择(部门路由、意图分类等)
– score:有序评分(紧急度、风险等级等)
– noul:是/否/概率(违规判断、退订意图等)

内置置信度输出,支持在低置信度时 fallback 到 LLM,形成”快决策层 + 慢推理层”的分层架构。

认可度

  • GitHub Star:约 23,002(截至 2026-09-25),近期日增 +2,620
  • License:Apache-2.0(可商业使用,无需开源修改)
  • 集成覆盖:LangChain、LangGraph、MCP Server、TypeScript SDK、Nix flake、Docker
  • Trending:2026-09-25 登上 GitHub Trending 日榜

链接

GitHub:https://github.com/NandhaKishorM/laya

原作者

NandhaKishor M(GitHub: NandhaKishorM),独立开发者,项目由 Convai Innovations 联合发布。团队在模型训练与决策系统上有学术积累,仓库附带完整的 RLCD 微调流程与 Kaggle 免费 GPU 训练笔记本。

介绍

Laya 的技术核心是一个基于 ModernBERT-large 微调的非自回归决策模型。与传统 LLM 的”输入 prompt → 逐 token 生成”不同,Laya 的前向传播直接输出分类结果——没有采样、没有温度、没有 token 长度的不确定性,因此延迟极低且结果可复现。

推理成本方面,421M 参数在 M1 Max GPU 上单条英文决策约 34ms,Apple GPU 上约 13ms,CPU 模式约 139ms。内存占用约 1GB,主流笔记本即可运行。首次推理会触发 CUDA kernel 编译,建议在服务启动时做一次预热调用。

项目内置三个 checkpoint:
– English(默认):覆盖英语场景,含置信度校准
– Multilingual:支持 100+ 语言,窗口 8,192 token
– Fast:轻量版,延迟更低

模型默认已对概率做校准(fitted temperature),输出置信度可以直接当作决策阈值依据,不需要额外标定。

特点

  • 零 token 输出:不做语言生成,只输出决策结果,消除 LLM 生成层的幻觉风险
  • 33ms 低延迟:单次前向传播,速度比任何 LLM API都快,适合高频决策场景
  • 完全本地:数据不离开机器,支持 CUDA / Apple MPS / CPU 多后端
  • Apache-2.0 许可:可商业集成,无需开源修改或上报权重
  • MCP 原生支持:提供官方 MCP Server,直接暴露 laya_predict / laya_route / laya_status 工具
  • 微调支持:附 Kaggle 笔记本,2×T4 免费 GPU 约 4 小时可微调到目标领域

使用方法

pip 安装(Python):

pip install laya

基础调用:

from laya import Router

router = Router()  # 首次自动下载 checkpoint

state = "Hi, we were billed twice for March. Refund the duplicate today or we cancel."

questions = {
    "department": {
        "type": "choice",
        "instructions": "Which team handles this?",
        "criteria": {
            "billing": "invoices, payments, refunds",
            "technical": "bugs, outages",
            "other": "everything else"
        }
    },
    "urgency": {
        "type": "score",
        "instructions": "How urgent?",
        "criteria": ["not urgent", "soon", "blocking"]
    },
    "churn_risk": {
        "type": "noul",
        "instructions": "Do they threaten to cancel?"
    }
}

r = router.predict(state, questions)
print(r["answers"]["department"]["choice"])  # billing
print(r["answers"]["churn_risk"]["noul"])    # probability = yes

HTTP 服务模式(laya-serve):

pip install "laya[serve]"
python -m laya.serve
# POST http://localhost:8000/v1/systemone
# 兼容 TypeSafe Jev API 格式,迁移只需改 base URL

MCP Server 模式:

pip install "laya[mcp]"
# 暴露 laya_predict, laya_route, laya_preset, laya_status 四个工具

使用场景与人群

适用场景:
– 工单/客服消息的自动路由(billing / technical / other)
– 意图分类与置信度过滤(低置信度再交给 LLM 处理)
– 文本审核与合规检查(判断是否违规、是否含敏感词)
– 优先级/紧急度评分(工单、漏洞、事件分级)
– RAG 系统的检索相关性过滤

目标用户:
– 需要高频决策但不想烧 LLM API 成本的团队
– 对数据隐私有要求的场景(工单数据不上云)
– 正在构建 Agent 流水线,需要在 LLM 之前加一层快速过滤的架构师
– 对延迟敏感的实时系统

输入与输出案例

案例一:客户消息路由

Input state: "Hi, we were billed twice for March. Refund the duplicate today or we cancel."
Questions:
  - department (type=choice): billing / technical / other
  - urgency (type=score): not urgent / soon / blocking
  - churn_risk (type=noul): Do they threaten to cancel?

Output:
  department: "billing" (confidence: 0.94)
  urgency: "blocking" (confidence: 0.87)
  churn_risk: probability=0.91 (yes)

案例二:意图分类与置信度过滤

Input state: "I need to cancel my subscription immediately"
Questions:
  - intent (type=choice): upgrade / downgrade / cancel / other
  - confidence (type=noul): Is the cancellation intent clear?

Output:
  intent: "cancel" (confidence: 0.96)
  confidence: probability=0.98 (yes → 自动处理,无需人工审核)

低于 0.85 置信度的请求可以自动转发给 LLM 做二次确认,形成”快筛 + 精判”的分层架构。


GitHub: https://github.com/NandhaKishorM/laya

评论区

0 条评论

登录后可评论。

Skill超级捕获手 83 阅读