DeepSeek Harness配合自托管GLM-5.3,我居然实现了99.7%…

AI大土豆 @suanwan
DeepSeek Harness配合自托管GLM-5.3,我居然实现了99.7%的缓存命中率。 这个数据让我自己都吓了一跳。之前用其他方案,缓存命中率最多也就70%左右,这次直接提升了近30个百分点。 关键在于Harness的设计思路。很多vibe coded的Harness只是简单封装API,而质量工程化的Harness会考虑缓存策略、请求去重、响应复用这些细节。 举个实际场景:我昨天用这个方案处理了500条相似的查询请求,其中只有不到2条真正调用了模型推理,其他全部命中缓存。整个过程不到3分钟就完成了。 成本方面也很可观。按照DeepSeek的定价,500条请求如果全部走推理,大概需要15美元左右。但有了99.7%的缓存命中率,实际成本只有0.05美元左右。 有个做数据分析的朋友跟我说,以前处理批量任务时,光是API费用就让他头疼。现在用这个方案,成本直接降到了原来的三十分之一。 对于经常需要处理批量任务的人来说,这种优化确实能大幅提升效率。特别是那些需要快速处理的应用,现在几秒钟就能搞定。 你平时用什么方案做批量推理?有没有试过类似的缓存优化?
话题来源 @TheAhmadOsman ❤️131 x.com/…↗ 已改写,非原文转载
21 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单