Hindsight Skill:让 AI Agent 学会记住而非仅存放的长期记忆系统

Hindsight 让 AI Agent 学会”记住”而非仅仅”存放”。传统 RAG 把记忆当存储桶,而 Hindsight 用三层记忆架构(世界事实→经验→心智模型)让 Agent 主动从历史中提取规律,在 LongMemEval 基准上刷到 SOTA,且是唯一被独立机构(Virginia Tech + 华盛顿邮报)复现验证的项目。GitHub 近期周涨 1.7 万星,多次登顶 Trending,是当前 Agent Memory 赛道涨速最快的项目。

功能与原则

Hindsight 是一个专为 AI Agent 打造的长期记忆系统,核心能力围绕”学习”而非”检索”展开。设计原则:

  • 记忆即学习:记忆不是文本块,而是结构化事实——实体、属性、关系、时间上下文全部原子化抽取,Agent 可直接基于记忆做推理而非做向量相似度搜索。
  • 三类记忆操作:Retain(写入,LLM 从对话中提取并分类到记忆网络)、Recall(召回,四路并行检索语义+关键词+图谱+时间线,RRF 融合重排)、Reflect(反思,跨会话提炼高层心智模型)。
  • 五层记忆架构:L1 世界事实 → L2 经验 → L3 观察 → L4 心智模型 → L5 知识页面,模拟人类记忆的认知层级。
  • 自验证基准:自建 BEAM Benchmark(百万 Token 级),64.1% 准确率(10M Token 层),其他项目同指标约 40.6%。

认可度

  • GitHub Star:约 43,500+ 星(截至 2026-10-02),近一周涨约 17,365 星,多次登顶 GitHub Trending 总榜。
  • LongMemEval 基准:State-of-the-Art,结果由 Virginia Tech Sanghani Center 和 The Washington Post 独立复现,非自报数据。
  • BEAM Benchmark(10M Token 层):64.1%,同类最高。
  • 生产使用:Fortune 500 企业已有部署。
  • 集成生态:Claude Code、LangGraph、CrewAI、Pydantic AI、Agno、Strands 官方集成。

链接

GitHub:https://github.com/vectorize-io/hindsight
官方文档:https://hindsight.vectorize.io/
在线基准:https://benchmarks.hindsight.vectorize.io/
论文:arXiv 2512.12818

原作者

Vectorize.io(Boulder 创业公司)— 2024 年获 True Ventures $3.6M 种子轮融资。创始团队专注 AI Memory 赛道,Hindsight 是其核心产品。项目采用 MIT 许可证。

介绍

大多数 Agent 记忆方案本质上是”更贵的向量数据库”——把历史对话切成块、存起来、检索回来。Hindsight 从根本上重新思考这个问题:Agent 的记忆应当像人类一样具备学习能力,而不是一个只进不出的文件柜。

Hindsight 的记忆组织模拟人类认知科学中的三类记忆:World Facts(客观世界事实)、Experiences(经验性事实)、Mental Models(高层心智模型)。当 Agent 与用户对话时,Retain 操作会让 LLM 主动提取对话中的实体、关系、时序信息,写入对应记忆层;Recall 操作通过四路并行检索(语义向量 + BM25 关键词 + 实体图谱 + 时间线)找到相关内容,再用 Reciprocal Rank Fusion 合并排序;Reflect 操作则跨会话分析,在更高层次上提炼规律和模式。

这带来的实际差异是:传统 RAG 在多会话后记忆会膨胀到检索质量下降,而 Hindsight 的五层架构让 Agent 记住的是”规律”而非”对话日志”。当 Agent 在新会话中遇到类似场景时,召回的内容是结构化的经验总结,而非一堆需要再推理的原始对话碎片。

特点

  • SOTA 基准表现:LongMemEval 91%、BEAM 10M Token 层 64.1%,同类唯一第三方验证数据。
  • 四路并行检索:语义 + 关键词 + 图谱 + 时间线同步召回,RRF 融合,比纯向量检索更鲁棒。
  • 多 LLM 支持:兼容 25+ LLM 提供商,支持 Claude Code、OpenAI Codex、Cursor、GitHub Copilot 用现有订阅直接跑(无需额外 API Key)。
  • MCP 原生支持:一个 JSON 配置即可接入 Claude、Cursor、Windsurf 等主流 Agent。
  • 存储灵活:PostgreSQL + pgvector(本地),或 Oracle AI Database 23ai(企业);记忆银行隔离,多租户安全。
  • Docker 一键部署:docker run 两行命令即可本地启动,Python/TypeScript/Go/CLI 多客户端。
  • 活跃迭代:v0.10.1(2026-09-21),每周都有新功能发布。

使用方法

快速启动(Docker):

export OPENAI_API_KEY=sk-xxx
docker run --rm -it 
  -p 8888:8888 -p 9999:9999 
  -e HINDSIGHT_API_LLM_API_KEY=$OPENAI_API_KEY 
  -v $HOME/.hindsight-docker:/home/hindsight/.pg0 
  ghcr.io/vectorize-io/hindsight:latest
# API: http://localhost:8888 | Web UI: http://localhost:9999

Python 客户端集成(2 行代码):

from hindsight import Hindsight
agent = Hindsight()  # 自动连接本地服务

Claude Code 接入:
编辑 ~/.claude/settings.json,添加 Hindsight MCP server URL。

CLI 方式:

hindsight fs --help  # 知识页面管理
hindsight recall "用户上次反馈了哪些问题"  # 直接召回

使用场景与人群

适用场景:
– 需要跨会话记住用户偏好、项目背景、技术债务的 AI 助手。
– 多 Agent 协作时,共享项目级记忆(而非各自从头构建上下文)。
– 复杂项目接手:新成员/新 Agent 通过检索记忆快速了解项目历史和决策过程。
– 客户服务、心理咨询、法律咨询等需要持续跟踪对话状态的长程 AI 应用。

目标用户:
– AI 应用开发者(构建有状态 Agent 产品)。
– 企业 AI 团队(需要 Agent 在多轮对话中保持一致性和记忆连贯性)。
– 研究者(关注 Agent Memory 基准与评估)。

输入与输出案例

案例 1:代码审查 Agent 的记忆积累

Input(新会话):"用户上次让我优化数据库查询,我做了哪些改动?"

Hindsight Recall 输出:

经验记忆:2026-09-28,Agent 为用户优化了 orders 表的 N+1 查询,引入索引 idx_user_created,QPS 从 120 提升至 890。用户在对话中确认满意。
心智模型:用户偏好先给数据,再给方案,不喜欢直接改生产环境代码。

Agent 收到这段结构化记忆后,不需要翻找历史对话日志,直接基于经验回答并补充:”上次优化了订单查询,索引方案用户已确认,这次可以继续沿用这个方向。”


案例 2:新会话上下文构建

Input(新会话第一轮):"继续上次那个数据分析的项目" → Hindsight Retain 从上一会话提取

Hindsight 输出(构建上下文包):

L1 世界事实:项目名 DataPulse,仓库 github.com/acme/datapulse,2026-08 启动。
L2 经验:已完成的模块——数据清洗(Pandas)、API 对接;遇到的主要障碍——某境外 API 返回格式不一致。
L4 心智模型:用户希望先跑通端到端 Demo,再优化性能;数据源稳定性优先于分析深度。

Agent 拿到这段上下文包,无需用户解释项目背景,直接进入工作状态。


GitHub: https://github.com/vectorize-io/hindsight

评论区

0 条评论

登录后可评论。

Skill超级捕获手 91 阅读