Hindsight Skill:让 AI Agent 学会记住而非仅存放的长期记忆系统
Hindsight 让 AI Agent 学会”记住”而非仅仅”存放”。传统 RAG 把记忆当存储桶,而 Hindsight 用三层记忆架构(世界事实→经验→心智模型)让 Agent 主动从历史中提取规律,在 LongMemEval 基准上刷到 SOTA,且是唯一被独立机构(Virginia Tech + 华盛顿邮报)复现验证的项目。GitHub 近期周涨 1.7 万星,多次登顶 Trending,是当前 Agent Memory 赛道涨速最快的项目。
功能与原则
Hindsight 是一个专为 AI Agent 打造的长期记忆系统,核心能力围绕”学习”而非”检索”展开。设计原则:
- 记忆即学习:记忆不是文本块,而是结构化事实——实体、属性、关系、时间上下文全部原子化抽取,Agent 可直接基于记忆做推理而非做向量相似度搜索。
- 三类记忆操作:
Retain(写入,LLM 从对话中提取并分类到记忆网络)、Recall(召回,四路并行检索语义+关键词+图谱+时间线,RRF 融合重排)、Reflect(反思,跨会话提炼高层心智模型)。 - 五层记忆架构:L1 世界事实 → L2 经验 → L3 观察 → L4 心智模型 → L5 知识页面,模拟人类记忆的认知层级。
- 自验证基准:自建 BEAM Benchmark(百万 Token 级),64.1% 准确率(10M Token 层),其他项目同指标约 40.6%。
认可度
- GitHub Star:约 43,500+ 星(截至 2026-10-02),近一周涨约 17,365 星,多次登顶 GitHub Trending 总榜。
- LongMemEval 基准:State-of-the-Art,结果由 Virginia Tech Sanghani Center 和 The Washington Post 独立复现,非自报数据。
- BEAM Benchmark(10M Token 层):64.1%,同类最高。
- 生产使用:Fortune 500 企业已有部署。
- 集成生态:Claude Code、LangGraph、CrewAI、Pydantic AI、Agno、Strands 官方集成。
链接
GitHub:https://github.com/vectorize-io/hindsight
官方文档:https://hindsight.vectorize.io/
在线基准:https://benchmarks.hindsight.vectorize.io/
论文:arXiv 2512.12818
原作者
Vectorize.io(Boulder 创业公司)— 2024 年获 True Ventures $3.6M 种子轮融资。创始团队专注 AI Memory 赛道,Hindsight 是其核心产品。项目采用 MIT 许可证。
介绍
大多数 Agent 记忆方案本质上是”更贵的向量数据库”——把历史对话切成块、存起来、检索回来。Hindsight 从根本上重新思考这个问题:Agent 的记忆应当像人类一样具备学习能力,而不是一个只进不出的文件柜。
Hindsight 的记忆组织模拟人类认知科学中的三类记忆:World Facts(客观世界事实)、Experiences(经验性事实)、Mental Models(高层心智模型)。当 Agent 与用户对话时,Retain 操作会让 LLM 主动提取对话中的实体、关系、时序信息,写入对应记忆层;Recall 操作通过四路并行检索(语义向量 + BM25 关键词 + 实体图谱 + 时间线)找到相关内容,再用 Reciprocal Rank Fusion 合并排序;Reflect 操作则跨会话分析,在更高层次上提炼规律和模式。
这带来的实际差异是:传统 RAG 在多会话后记忆会膨胀到检索质量下降,而 Hindsight 的五层架构让 Agent 记住的是”规律”而非”对话日志”。当 Agent 在新会话中遇到类似场景时,召回的内容是结构化的经验总结,而非一堆需要再推理的原始对话碎片。
特点
- SOTA 基准表现:LongMemEval 91%、BEAM 10M Token 层 64.1%,同类唯一第三方验证数据。
- 四路并行检索:语义 + 关键词 + 图谱 + 时间线同步召回,RRF 融合,比纯向量检索更鲁棒。
- 多 LLM 支持:兼容 25+ LLM 提供商,支持 Claude Code、OpenAI Codex、Cursor、GitHub Copilot 用现有订阅直接跑(无需额外 API Key)。
- MCP 原生支持:一个 JSON 配置即可接入 Claude、Cursor、Windsurf 等主流 Agent。
- 存储灵活:PostgreSQL + pgvector(本地),或 Oracle AI Database 23ai(企业);记忆银行隔离,多租户安全。
- Docker 一键部署:
docker run两行命令即可本地启动,Python/TypeScript/Go/CLI 多客户端。 - 活跃迭代:v0.10.1(2026-09-21),每周都有新功能发布。
使用方法
快速启动(Docker):
export OPENAI_API_KEY=sk-xxx
docker run --rm -it
-p 8888:8888 -p 9999:9999
-e HINDSIGHT_API_LLM_API_KEY=$OPENAI_API_KEY
-v $HOME/.hindsight-docker:/home/hindsight/.pg0
ghcr.io/vectorize-io/hindsight:latest
# API: http://localhost:8888 | Web UI: http://localhost:9999
Python 客户端集成(2 行代码):
from hindsight import Hindsight
agent = Hindsight() # 自动连接本地服务
Claude Code 接入:
编辑 ~/.claude/settings.json,添加 Hindsight MCP server URL。
CLI 方式:
hindsight fs --help # 知识页面管理
hindsight recall "用户上次反馈了哪些问题" # 直接召回
使用场景与人群
适用场景:
– 需要跨会话记住用户偏好、项目背景、技术债务的 AI 助手。
– 多 Agent 协作时,共享项目级记忆(而非各自从头构建上下文)。
– 复杂项目接手:新成员/新 Agent 通过检索记忆快速了解项目历史和决策过程。
– 客户服务、心理咨询、法律咨询等需要持续跟踪对话状态的长程 AI 应用。
目标用户:
– AI 应用开发者(构建有状态 Agent 产品)。
– 企业 AI 团队(需要 Agent 在多轮对话中保持一致性和记忆连贯性)。
– 研究者(关注 Agent Memory 基准与评估)。
输入与输出案例
案例 1:代码审查 Agent 的记忆积累
Input(新会话):"用户上次让我优化数据库查询,我做了哪些改动?"
Hindsight Recall 输出:
经验记忆:2026-09-28,Agent 为用户优化了
orders表的 N+1 查询,引入索引idx_user_created,QPS 从 120 提升至 890。用户在对话中确认满意。
心智模型:用户偏好先给数据,再给方案,不喜欢直接改生产环境代码。
Agent 收到这段结构化记忆后,不需要翻找历史对话日志,直接基于经验回答并补充:”上次优化了订单查询,索引方案用户已确认,这次可以继续沿用这个方向。”
案例 2:新会话上下文构建
Input(新会话第一轮):"继续上次那个数据分析的项目" → Hindsight Retain 从上一会话提取
Hindsight 输出(构建上下文包):
L1 世界事实:项目名 DataPulse,仓库 github.com/acme/datapulse,2026-08 启动。
L2 经验:已完成的模块——数据清洗(Pandas)、API 对接;遇到的主要障碍——某境外 API 返回格式不一致。
L4 心智模型:用户希望先跑通端到端 Demo,再优化性能;数据源稳定性优先于分析深度。
Agent 拿到这段上下文包,无需用户解释项目背景,直接进入工作状态。
评论区
登录后可评论。