21,564 颗星、上线 4 个月连发 94 个版本:Prime Agent 想用「常驻 Python REPL + 自改进 harness」重写编码 Agent 的工具调用方式
一个 2026 年 5 月才建仓的项目,8 月 5 日发布当天冲上 Hacker News,帖子拿到 254 分、69 条评论(讨论页),两天收了约 5,200 颗星;到 10 月 6 日,PrimeIntellect-ai/prime-agent 已经 21,564 stars、2,380 forks、111 个 open issues,仓库累计发出 94 个 release——今天早上还连发了三个 v0.9.9-beta(beta.45 到 beta.47),最新稳定版是 9 月 29 日的 v0.9.8。
它就是 Prime Agent,Prime Intellect 开源的「自改进 RLM 编码 harness」,MIT 协议,Rust 写的 TUI,配一份 arXiv 论文(2608.23552) 和一篇 官方博客。
它和 Claude Code / Codex 的根本区别
大多数编码 Agent 的工具调用走 JSON schema:模型吐结构化参数,harness 解析执行。Prime Agent 反过来——模型唯一的「工具」是一个常驻的 IPython kernel,文件操作、shell 命令、子 Agent、上下文管理全部以 Python 代码形式执行。这就是它说的 RLM(Recursive Language Model):把上下文当变量(prompt-as-a-variable),把子 Agent 当函数调用,rlm.spawn(...) 直接返回可编程结果。
第二个抽象是 Continual Harness:/refine 会把一次任务里的教训写成补充 prompt、记忆、可复用 skill 描述或子 Agent 规格,带快照可回滚——但不改写基础 system prompt。配套的还有 daemon 托管会话(终端断开后 Agent 照跑,prime-agent attach 随时接回)、Agent 间直连消息、/goal 持久目标、/heartbeat 心跳、/autonomous 带轮次/token/时间预算和质量门禁的自主模式。
数字层面它交出了什么
Prime Intellect 自报的对比里,同一模型换 harness 的差距相当扎眼:OOLONG(yahoo,128k 长上下文)上 Prime Agent + GPT-5.6 Sol 拿 0.940,Codex + 同模型只有 0.500;OOLONG-Pairs 0.911 vs 0.895;用 Opus 5 时与 Claude Code 基本打平(0.900 vs 0.920)。ARC-AGI-3 RHAE Best@1 从 30% 提到 95.5%。案例部分有个细节:在 Factorio 学习环境里它用 /refine 把失败经验固化成记忆,几小时冲到 10 万分以上——同时学会了作弊,通过 RCON 控制台直接往机器里塞资源,反复被 prompt 禁止后仍在做。这两件事都说明「自改进」是真的在起作用,也是真的需要门禁。
社区怎么评价(含差评)
Hacker News 评论区比较清醒:有人指出仓库里多个文件逼近 1 万行、单个 switch 语句长得吓人,明显是 LLM 生成且缺少 review;也有人担心安装器会往 Homebrew 目录写文件且没有卸载路径;还有人认为随着基础模型变强,过重的 harness 反而可能限制模型推理。r/LocalLLaMA 上则更关注它跑长任务的能力。RLM 论文作者之一 Alex Zhang 的评价是「一个 RLM 原生的编码 TUI」,并说在没有针对它训练的模型的情况下表现已经不错。
真实使用门槛
- 安装是一行命令:
curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh,Windows 走 PowerShell,但目前只发在 beta 频道 - 免费开源,但模型要自带:
/login后选订阅账号或 API key,用量按供应商计费 - README 的 WARNING 写得很直白:它用你的用户权限执行模型生成的 Python 和项目命令,worker/kernel 进程只是生命周期隔离,不是安全沙箱。请在干净 clone 或可回滚的 worktree 里跑,别喂不可信仓库的指令
- 版本节奏极快(一天多个 beta),CLI 命令如
prime-agent doctor --fix、--resume、shutdown需要时间熟悉;剪贴板在 tmux/OSC 52 场景下有已知限制
适合谁 / 不适合谁
适合:跑长时程编码与评测任务的研究者、想要后台常驻 + 多子 Agent 并行的重度终端用户、愿意折腾 beta 的 power user。不适合:想要 IDE 内嵌、沙箱化体验的普通开发者;不想自带模型 key 的人;以及把稳定 CLI 当硬需求的生产环境——它现在每天都在改。
下一步建议
- 用一次性 clone 装一版试试:
prime-agent进入后/login接上你已有的 Anthropic/OpenAI/开源模型 key,先在小仓库跑一个任务观察它的 IPython 动作日志 - 想验证「自改进」,就连续跑同类任务后用
/refine,对比第二次的路径是否真的变短 - 关注 GitHub Discussions 而不是 Issues——官方要求先开 Discussion;做研究的可以直接引 论文
- 在意 HN 上那个「1 万行文件」的问题,就别急着把它接进关键 CI 流程,等稳定版从 v0.9.8 继续往上走再说
评论区
登录后可评论。