时间
2026年9月
地点
瑞典斯德哥尔摩(Spotify总部)
人物
Spotify工程师
事件详情
Spotify工程师在官方博客披露内部工具Portal的实测效果:通过AiKA Modes架构将Claude Code的大文件读取和样板代码生成任务路由至更廉价的Gemini 2.5 Flash,使前端模型Token消耗降低约90%。
具体实现上,Spotify为Claude Code开发了名为"shunt"的插件,在PreToolUse钩子处拦截超过350行的文件读取操作,自动将任务分发给Portal的bulk-reader模式。该模式先索引代码仓库,再以结构化摘要代替完整文件内容输入给前端模型,从源头减少累积的上下文Token。code-writer模式则直接写代码到磁盘,全程不占用Claude的上下文窗口。
Java单体仓库四场景基准测试显示,bulk-read场景平均节省约90% Token。按当前趋势预计到2028年,AI编程成本将超过工程师平均薪资,部分团队已为每位工程师每月消耗200至500美元的Token。
背景
大多数AI编程助手的工作负载本质是I/O操作而非推理——读取多个文件来回答一个方法的问题、按现有模式生成测试文件、会议后更新文档。这些任务对前沿模型来说是"杀鸡用牛刀",却仍在消耗大量Token。
传统的上下文窗口扩大并不能解决问题,只会提高浪费的上限。真正有效的是精确管理输入给模型的上下文内容。
影响
此次披露为AI编程工具的成本优化提供了可复制的工程范例。模型路由从"一条规则"变为"可配置",团队可fork公开的AiKA模式并自定义路由策略。
局限性在于:代理模型无法处理编辑、深度推理和安全关键代码;每次路由额外增加10至30秒延迟;低于350行阈值的文件不值得路由开销。
总结
Spotify通过Portal证明,AI编程的成本控制核心在于精细化上下文管理,而非单纯扩大模型上下文窗口。将I/O任务路由至廉价模型、前沿模型专注复杂推理,这一架构思路可推广至整个AI编程工具赛道。
参考来源
https://engineering.atspotify.com/2026/9/portal-by-spotify-cut-my-claude-code-token-usage-by-90
https://news.lavx.hu/article/spotify-s-portal-cuts-ai-coding-token-costs-90-with-model-routing
https://axbrief.com/en/article/49571465
https://www.contentbuffer.com/news/spotify-portal-cuts-claude-code-token-usage-90-44a6c9ac
https://clawdbytes.com/article/2026-09-05-portal-by-spotify-cut-my-claude-code-token-usage-by-90.html
https://randomchaos.us/articles/context-is-the-whole-bill
https://headlinesbriefing.com/dev/hacker-news/spotifys-portal-cuts-ai-coding-token-costs-by-90-48acab51









