时间:2026 年 10 月 8 日至 10 日(模型 10 月 8 日上传至 Hugging Face,10 月 9 日至 10 日经多家媒体报道)
地点:美国(Underdog 团队),发布渠道为 Hugging Face 与 Underdog 官网
人物:本地 AI 助手 Underdog(模型卡署名 Conway Research,为 a16z 投资的本地/端侧助手团队)、阿里 Qwen 团队(Qwen3.8-27B 基座模型)、ISTA-DASLab(其 Qwen3.8-27B-GSQ-RCO-GGUF 被作为量化基座)、伯克利大学 BFCL 团队(工具调用评测题来源)
事件详情:Underdog 发布 Saluki 27B 1.0,把 Qwen3.8-27B 压进单个 7.89 GB 的 IQ2-mix GGUF 文件(原版约 54 GB,体积缩到约七分之一),采用标准 llama.cpp 格式,原版 llama.cpp 及其衍生应用可直接加载,无需自定义编译。官方 Underdog Bench 取自伯克利 function calling 排行榜(BFCL v4)的 120 道工具调用题,题目在 9 月 27 日、任何模型受测前冻结,统一以思考关闭、温度 0 运行:Saluki 通过 88 道,全尺寸 Qwen3.8-27B 通过 84 道;同门 Main 版本(7.9 GB)91 道、Mia 2-bit(9.1 GB)85 道、ISTA 2-bit(8.4 GB)76 道、三值 Bonsai 2(5.95 GB)70 道。100 道并行工具调用题上,Saluki 严格评分通过 42 道、宽容格式评分通过 55 道,全尺寸原版均为 35 道。模型以 Apache 2.0 发布,主文件为纯文本,另提供 928 MB(F16)与 629 MB(Q8_0)可选视觉投影文件;思考模式默认开启、可按请求关闭,quickstart 只需 llama-server 加 --jinja 参数,即以 OpenAI 兼容 API 监听 8080 端口。
背景:Qwen3.8-27B 是阿里 Qwen 团队的开源 270 亿参数模型,Underdog 官网援引 Artificial Analysis 称其表现超过半年前的前沿模型 Claude Opus 4.6 Max;但 54 GB 的体积让普通笔记本难以承载,2-bit 量化由此成为端侧部署的主流路径。与它同台比较的 Mia、ISTA、Bonsai 2 等 2-bit/三值版本均在 5.95 至 9.1 GB 之间。Underdog 表示 Saluki 针对智能体场景专门调优,重点保住工具选择与参数填写能力,而非竞赛数学;其取舍明确——AIME 2025 平均 79.2 分、AIME 2026 平均 80.0 分,只保住全尺寸模型的约 82% 至 85%,SWE-bench Verified 为 30(原版 33)、MBPP+ 为 78.0(原版 83.9),IFEval 则为 93.5(原版公开分 91.5)。
影响:7.89 GB 意味着 270 亿参数模型可在 16 GB 内存笔记本与 8 GB 级显存设备上运行,工具调用这一"聊天模型变智能体"的关键能力在消费级硬件上首次接近全尺寸水平,本地私有部署的智能体无需把数据送出机器;OpenAI 兼容接口让 LangChain 等框架只改 base_url 即可接入。局限同样清晰:约五分之一的并行调用回复存在格式瑕疵(宽容解析可把 42 道提升到 55 道),字母级文字游戏类指令最弱,且模型卡未公开量化配比、校准数据与"保住工具调用"的具体训练步骤,第三方暂难复现;同门 Main 版本分数更高(91 对 88),Saluki 并非同门最强。
总结:Underdog 用 2-bit 量化把 Qwen3.8-27B 压到 7.89 GB 并在工具调用测试上反超 54 GB 原版,说明量化模型的竞争焦点已从"能不能跑"转向"智能体能不能用";在各家竞逐大参数与云端算力的同时,端侧小模型正以工具调用为切口争夺本地智能体入口,不过 120 道题的样本量与自建评测的公信力仍需第三方验证。
参考来源:
- Hugging Face 模型卡:https://huggingface.co/ConwayResearch/Underdog-Saluki-27B-1.0
- Underdog 官方页面:https://underdog.ai/saluki
- IT之家:https://www.ithome.com/1/011/219.htm
- Explainx:https://www.explainx.ai/blog/underdog-saluki-27b-qwen3-8-27b-2-bit-gguf-tool-calling-2026
- MindStudio:https://www.mindstudio.ai/blog/underdog-saluki-27b-local-llm
- KuCoin News:https://www.kucoin.com/news/flash/underdog-compresses-qwen3-8-27b-to-7-89gb-with-enhanced-tool-calling-performance







