热门AI工具推荐

焚书AI多模型聚合平台
AI多模型聚合平台( Claude 系列、GPT 系列)支持聊天、搜索、图片、视频、音乐等多种功能;聚合了 Claude 系列(如 Sonnet 5、Opus 5 等)、Gemini 系列、GPT 系列、DeepSeek(搜索模式默认调用 DeepSeek V4 Pro)以及通义千问、Kimi 等数十款国内外主流模型。
AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

llama.cpp支持决策模型 5款开源GGUF已上线

时间:2026年10月2日(Xuan-Son Nguyen 和 Victor Mustar 在 ggml-org 官方博客发布) 地点:开源项目 llama.cpp(GitHub 仓库 ggml-org/llama.cpp) 人物:Xuan-Son Nguyen,llama.cpp 核心贡献者;Victor Mustar,Hugging Face 工程师;TypeSafe AI 团队(Jev 模型原作者) 事件详情:llama.cpp 正式发布 PR #29818,在 llama-server 中加入全新 /v1/systemone API 端点,支持本地运行 TypeSafe Jev 风格的决策模型。开发者现在可通过 llama serve -hf ggml-org/... 命令一键启动决策模型服务,并通过标准 HTTP 接口调用。本次首发支持 5 个开源 GGUF 模型:Julia-1(144M,基于 mmBERT-small)、Laya(421M,基于 ModernBERT-large)、Kev-4B(4B,基于 Qwen3.5-4B-Base)、lev(4B,基于 Qwen3.5-4B)、OpenJev(27B,基于 Qwen3.8-27B)。其中 OpenJev 是唯一支持图片输入的视觉决策模型。请求支持三种问题类型:choice(多选一,带概率)、score(2 到 10 级评分)、noul(yes/no 概率)。响应中 output_tokens 始终为 0,因为模型只做一次前向推理,不生成文本。在 RTX PRO 6000 上,Julia-1 单问题响应仅需 3 毫秒,OpenJev 也仅 43 毫秒。 背景:决策模型(Decision Model)是 2026 年新兴的 AI 范式,由 TypeSafe AI 在 9 月率先推出 Jev 模型,主打以概率形式对预设选项打分,而非生成完整文本,特别适合客服路由、内容审核、智能体步骤校验、动作选择等高频低延迟场景。Jev 发布 9 天即估值破百亿,触发 TypeSafe 再启 10 亿美元融资。Cloudflare 在 10 月初推出 Clef 和 Clef-flact 两个决策模型,宣称中位延迟 39 毫秒,是 Jev 的 13 倍。亚马逊、Meta、Anthropic 等大厂也开始跟进该方向。决策模型填补了大语言模型与传统分类器之间的中间地带:LLM 推理慢、输出不确定,传统分类器每次新增类目都要重新训练。llama.cpp 此次原生支持意味着任何开发者都能在本地 CPU/GPU 上运行 Jev 风格的决策模型,无需依赖云端 API。 影响:llama.cpp 是全球最广泛使用的本地 LLM 推理引擎之一,社区用户超百万。此次原生集成决策模型,将原本需要专用 API 或自建服务的决策能力下放到单机本地,显著降低延迟、保护隐私、削减成本。Apache 2.0 协议下的 4 个模型(Julia-1、Laya、Kev-4B、lev)可商用,为企业部署决策模型扫清许可障碍。短期内,本地客服、智能体编排平台、内容审核系统等场景将出现一波迁移潮;长期看,决策模型可能成为继 LLM 之后下一个 AI 推理基础设施层,与 LLM 形成"快思考/慢思考"互补架构。 总结:llama.cpp 通过 PR #29818 将 TypeSafe Jev 风格的决策模型纳入本地推理生态,开源 5 款 GGUF 模型覆盖 144M 到 27B 全谱系,最低 3 毫秒响应、最高支持图片输入。这一动作让决策模型从云端专属能力变为任何开发者都能在本地调用的基础设施,标志着 AI 推理正进入"LLM + Decision Model"双轨时代。 参考来源: 1. https://huggingface.co/blog/ggml-org/decision-models-in-llamacpp 2. https://explainx.ai/blog/llama-cpp-decision-model-support-2026 3. https://www.reddit.com/r/LocalLLaMA/comments/1wvqbrz/llama_server_add_v1systemone_api_models_laya/ 4. https://github.com/ggml-org/llama.cpp/discussions/29268 5. https://x.com/ItsmeAjayKV/status/2106039949292429633 6. https://huggingface.co/ggml-org/Julia-1-GGUF 7. https://github.com/ggml-org/llama.cpp/pull/29818