时间:2026年9月3日
地点:加拿大渥太华(Shopify 总部)
人物:Shopify CTO Mikhail Parakhin;Shopify 工程团队;Sidekick GraphQL Agent 团队
事件详情:电商平台 Shopify 工程团队于9月3日正式对外公开其内部研发的 Gisting(要点压缩)技术。该方法通过知识蒸馏把 LLM 长系统提示压缩为少量学到的"要点 token",在不修改模型权重的前提下,将 Sidekick GraphQL Agent 的系统提示从约 6000 个 token 压缩到 1500 个 gist token,压缩比 4:1,且预测质量无明显损失。在 350 RPM 的负载下,Time to First Token(TTFT)中位数从 438 毫秒降到 354 毫秒,端到端请求延迟从 6.8 秒降到 4.2 秒,吞吐量从 20.2 QPS 提升到 23.4 QPS,由此带来约 14% 的 GPU 配额节省。
背景:Gisting 技术源自 2022 年学术论文《Prompt Compression and Contrastive Conditioning for Controllability and Controllability of Language Models》。Shopify 在工程实现上做了三项关键改进:一是把原始 30 小时训练流程通过预计算 teacher logits 和预 token 化压缩到 6 小时;二是引入 autoresearch 自动调参以获得最佳压缩比;三是把 gist embeddings 写入模型 embedding matrix 并注册为特殊 token,使推理服务无需修改 attention mask 或新增编码器。该方案与 prefix caching 互补,可同时叠加,进一步压缩 KV cache 解码开销。
影响:Gisting 为长系统提示场景(如 RAG 上下文、API schema、Agent 指令集)提供了一种可在不损失能力的前提下削减 token 成本的工程化路径。Shopify CTO Mikhail Parakhin 在 X 上称其为"当下最被低估的 LLM 技术",并指出它把系统提示"打包压缩后再生产环境运行",延迟降低约 40%、吞吐提升约 15%。对依赖大模型 Agent 的企业来说,该方法把"长提示词带来的边际成本"从负担变成可优化变量,预计将推动更多 LLM 服务方引入类似的提示压缩方案。
总结:Shopify 工程团队公开 Gisting 提示压缩技术,将系统提示从 6000 token 压至 1500 gist token,4:1 压缩比下推理延迟降 38%、吞吐升 16%、GPU 占用减 14%,不需修改模型权重即可落地。
参考来源:
1. https://shopify.engineering/gisting
2. https://www.infoq.com/news/2026/09/spotify-gisting-llm-performance/
3. https://aipulselab.tech/news/shopify-introduces-gisting-compressing-llm-system-prompts-into-learned-tokens-4c20ef
4. https://digg.com/tech/vtty612i
5. https://agihunt.info/en/p/1a025b083cdc5a3b2abad20bc3b
6. https://arxiv.org/abs/2210.03162









