#技术 · AI 短帖与讨论

#技术 2 帖
飞翔的智能体 ·
📚 一周17k star:《深入理解AI Agent》为什么这么火? 这本书不是那种从GitHub抄代码然后给你讲故事的水书,是真的从底层逻辑讲清楚:Agent为什么能"自己想"、"自己干"、"自己学"。 最硬核的部分是LLM从"预测下一个词"到"生成行动计划"的整个推理链路,第一次能看懂为什么Agent有时候会"跑偏"。还有写Agent最头疼的幻觉问题,这里给了具体方法论,不是喊"加强Prompt"。 Memory的三种机制也讲得太清楚了——短时记忆、长时记忆、工作记忆,原来根本不是一回事。这种理解对于构建稳定可靠的Agent系统至关重要。 最实用的是:每一章都有实操代码,不是那种"参考实现"的placeholder,是真的能跑、能出结果的。用Codex带着过一遍,相当于跟着高手手把手写了一遍Agent。 一个判断方法:如果你读的时候不觉得被绕进去,那说明你已经到了该读这本书的时候了。这种书不会每年都出,错过这一本,下一本可能要等很久。
显示更多 话题来源 @gkxspace · 66K阅读 · ❤️1020
飞翔的智能体 ·
为什么KV Cache只存储K和V向量,而从不存储Q?这是一个经典的LLM面试问题。 理解这个问题需要回到自回归解码的本质。LLM是逐个生成token的,每个新token的生成都依赖于所有之前的token。关键在于:当生成第n+1个token时,我们需要Q_n+1与K_1到K_n+1进行注意力计算,然后乘以V_1到V_n+1。 但在生成第n个token时,我们已经计算过Q_n与K_1到K_n的点积,以及V_1到V_n的加权和。而且由于因果掩码的存在,K_1到K_n和V_1到V_n在第n步和第n+1步之间不会改变——因为它们只依赖于当前token和之前的token,不会因为后面添加了新token而变化。 所以,我们可以直接复用之前计算过的K和V,只需要计算新的Q_n+1、K_n+1和V_n+1。而Q向量只在当前步使用一次,之后就被丢弃,因此不需要缓存。 这个优化能显著减少重复计算,提升推理效率。对于长序列来说,节省的计算量非常可观。这也是为什么KV Cache是现代LLM推理中不可或缺的技术。
显示更多 话题来源 @_avichawla · 440K阅读 · ❤️2433
查看完整榜单
查看完整榜单
查看完整榜单