时间:2026年8月7日
地点:美国旧金山(Instacart 总部)
人物:Instacart CTO Anirban Kundu;Instacart 工程副总裁 Siby Alappatt;Instacart 软件工程总监 Alan Wong
事件详情:
Instacart 8 月 7 日正式推出 Blueberry——一款面向 on-call 工程师的 AI 辅助事故调查系统。该系统在工程师收到告警时自动并行启动约 10 个子代理,从内部事故库、服务所有权、部署、文档、日志等多源数据中收集上下文,3 分钟内输出基于事实的根因假设,并通过 Slack 工作流直接把结果投递到正在处理事故的频道中。Instacart 披露 Blueberry 4 月共执行约 25,000 次诊断、覆盖 270 多个 Slack 频道,根因诊断准确率借助 14 年历史事故数据从 60% 出头提升到 90% 以上。
背景:
大型生产系统的事故响应长期受困于"前期信息收集占去大半时间"的问题:on-call 工程师首先要确认服务归属、查最近部署、扫日志与指标、对照历史事故找共因,才能开始动手排查。Blueberry 把这套流程用多代理 + 工具感知的方式自动化,并刻意保留"由工程师最终下决策"的边界——系统只做信息聚合、假设生成与调试支持,不会自动变更生产。Instacart 把该系统定位为对"代理式 AI"在生产运维领域的探索,强调 ground in 内部组织知识、而非依赖通用语言模型的"裸推理"。
影响:
- Blueberry 把 SRE 行业从"通用 LLM 助手"推向"组织级历史数据 + 多代理编排 + 工作流集成"的方向,为 Datadog、PagerDuty、Splunk 等可观测性厂商的产品演进提供样本
- 25,000 次/月诊断、90%+ 准确率、3 分钟出结果,意味着大型科技公司的 on-call 体验正从"被动救火"转向"AI 协同分类与假设",进一步压缩故障平均恢复时间(MTTR)
- 系统主动把根因写入事故频道而非单独页面,避免工程师在不同工具间切换——这反映 AI Agent 在企业落地的关键不再是"能不能做",而是"是否嵌入现有协作流"
- Instacart 选择把工程师留在"最终决策者"位置而非完全自动响应,体现头部公司在 AI 代理可靠性与责任边界上的谨慎立场,可能成为行业可参考的责任划分范本
总结:
Instacart 用 Blueberry 展示了 AI Agent 在企业生产运维中的实战效果:14 年事故数据 + 10 个并行子代理 + 3 分钟根因假设 + Slack 工作流嵌入,把 on-call 工程师从繁琐的"信息收集阶段"中解放出来。90%+ 准确率与 25,000 次/月调用规模证明企业级 AI 代理已开始承担真正的高频生产任务,但 Instacart 仍坚持"系统只辅助、人做最终决策"的设计原则,反映出行业在 AI Agent 可靠性与责任边界上的成熟判断。
参考来源:
- https://www.infoq.com/news/2026/08/instacart-blueberry-sre-ai/
- https://tech.instacart.com/blueberry-force-multiplier-for-the-on-call-engineer-98c446dfcc12
- https://www.linkedin.com/posts/ankundu_blueberry-force-multiplier-for-the-on-call-activity-7485344932899995648-Yv1N
- https://www.linkedin.com/posts/sibyalappatt_blueberry-force-multiplier-for-the-on-call-activity-7485694707533217792-T5sg
- https://www.linkedin.com/posts/alankcwong_super-proud-of-the-team-in-launching-blueberry-share-7482870046621343744-dHzg