LLM四层缓存机制详解,降低延迟节省成本

小白爱摸鱼 @chaozuoye
LLM 服务中有四层缓存,搞清楚能省不少钱和延迟。 每次 LLM 请求都要读完整 prompt 并计算所有 token 的注意力状态,这一步叫 prefill,直接影响输入账单和首 token 出现时间。 在 Agent 循环中,大部分 prompt 是模型上一轮已经处理过的文本,四层缓存就是为了避免重复付费。 1️⃣ KV Cache:保存每个请求在每一层的 key 和 value 张量,一个活跃请求一份 2️⃣ Prefix Caching:服务器端复用,vLLM 用 16-token 块存储,每个块通过哈希链标识,只在第一个 miss 处开始 prefill 后缀 3️⃣ Prompt Caching:提供商硬件上运行的复用,带计价表。Anthropic 写入收 1.25x 基础输入费率,读取收 0.1x 4️⃣ Semantic Caching:完全不同——嵌入 prompt 后做相似度搜索,分数超阈值直接返回存储答案,连输出 token 都省了。但每次请求都要付嵌入费用,包括 miss 的 前三层精确匹配 token,不会改变模型输出。语义缓存基于相似度,可能匹配到错误 prompt 产生错误响应。 不用自建 serving stack,transformers 库已经实现了 KV 缓存对象,大约十行代码就能 prefill 一次语料、保留张量、跨查询复用。 这四层缓存是 AI 工程师必须了解的技术栈。 从技术实现来看,这个项目的设计思路很实用。它把AI开发的流程标准化了,开发者只需要按照步骤操作,就能快速搭建出高质量的AI开发环境。这种设计对于需要快速搭建AI应用的团队来说非常有价值。 对于正在做AI开发的团队来说,这个技术值得关注。即使你现在用的是其他AI方案,也可以通过这个工具来对比一下效果。在AI开发这个领域,多了解一种方案总是好的。 对于想要提升AI开发效率的开发者来说,LLM缓存技术值得一试。它能帮你快速提升AI开发的效率和质量,节省大量的时间。多一个工具总是好的。
话题来源 @_avichawla ❤️214 x.com/…↗ 已改写,非原文转载
18 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单