PRAXIST Skill:让 AI 科研团队自动迭代收敛的自主研究系统
PRAXIST 是由 Sapient Intelligence(GitHub 账号 sapientinc)于 2026 年 8 月 27 日开源的自主科研系统,定位是”你的个人 R&D 团队”——不是帮你调参的 AutoML,而是一套能在可量化、可执行的科研问题上实现多智能体并行研究、多代际证据积累与迭代收敛的完整工作流。该项目发布 5 天即冲上 GitHub Trending 榜首,累积超过 6,000 星,迅速引发 AI 科研社区热议,被认为是”把科研当作持续运行进程而非一次性 Prompt 会话”的新范式。
功能与原则
PRAXIST 的核心能力建立在三个设计原则上:并行研究同伴(Parallel Research Peers)——多个研究员智能体同时探索相互竞争的假设与实现;任务自有的评估(Task-Owned Evaluation)——指标、基线、评估协议由任务项目定义,PRAXIST 本身不携带任何领域假设,保证跨学科复现性;持久证据(Durable Evidence)——候选方案按孵化器(incubator)、前沿(frontier)、宝石(Gems)三态保留,确保好点子不被过早淘汰。每代研究结果由规划小组提炼为下一代的研究议程,循环直到收敛或预算耗尽,形成可审计的代际演进链。
认可度
GitHub 数据显示(截至 2026-09-02):约 6,785 星、559 forks,发布 5 天即登顶 GitHub Trending 全榜。arXiv 论文(arXiv:2608.25955)已在 MLE-bench 标准化评测集(75 项任务)提交官方评测结果:PRAXIST 获 60 枚奖牌(80.0%),其中 49 枚金牌;对比 Claude Code 基线(Claude Opus 4.8)仅获 55 枚奖牌(73.3%)、34 金牌。更关键的是,PRAXIST 记录的实际模型消耗为 $3,054,仅为 Claude Code 基线 $38,370 的约 1/12,被论文称为”第一个将更强结果与低一个数量级成本相结合的科研系统”。Discord 社区活跃,文档覆盖火箭回收、托卡马克磁控、定量交易、SLAM 等多个真实工程案例。
链接
GitHub:https://github.com/sapientinc/PRAXIST
官方文档:https://praxist.sapient.inc/en/docs
原作者
项目由 Sapient Intelligence 团队发布,主要作者包括 Jin Li、Ahmed Murtadha、Zhiyu Wang、Qiwen Chen、William Chen、Yifei Wu、Guan Wang 等,论文署名单位涉及多所高校与研究机构,团队背景覆盖 AI 系统、软件开发与科学计算。GitHub 账号 sapientinc 为项目官方账户。
介绍
PRAXIST 的核心理念源自一个观察:现有 AI Agent 系统大多以”单次 Prompt + 一次性任务”的方式工作,每次尝试几乎是自包含的——日志、记忆和搜索树记录了”发生了什么”,但没有记录”哪个设计元素产生了改进、该证据是否经过验证、以及它如何与其他元素重组”。这导致长期研究项目反复重学同样的教训。PRAXIST 将每次研究尝试的产出转化为类型化证据图(typed evidence graph),记录发现来源、验证状态和重组路径;将研究议程组织为车道结构前沿(lane-structured frontiers),让后来者可以直接继承已验证的机制、未解决的Claims和有价值的约束,而非从零开始。
架构上,Praxist(编排层)与 Task Projects(任务项目)严格分离:编排层负责智能体生命周期、并行调度、证据协议与代际综合;任务项目负责研究目标、可执行代码、评估器、指标、基线和领域约束。这种分离使 Praxist 成为通用科研基础设施——同一套系统可以服务于火箭回收策略优化、定量交易策略搜索、医学影像诊断流水线等完全不同领域的研究问题,只需替换任务项目层。
特点
- 代际积累(Generational Synthesis):每代研究结果由规划小组提炼为下一代议程,好方案跨代继承,避免重复试错
- 三态证据保留:incubator → frontier → Gems,候选方案按成熟度分层管理,防止早期好点子被误淘汰
- 任务解耦架构:Praxist 通用编排层 + Task Projects 领域专属层,跨学科复用,无需修改核心代码
- 可量化的评估闭环:任务项目定义评估协议与指标,PRAXIST 不带领域假设,保证评测结果的客观性与可复现性
- 多智能体并行探索:支持同时运行多个研究智能体探索相互竞争的假设,提高有效实验吞吐量
- 极低的科研成本:在 MLE-bench 上以 $3,054 成本超越 $38,370 的 Claude Code 基线,成本效益比约 12:1
使用方法
安装(一键式):
python3 -m pip install --index-url https://pypi.org/simple "praxist[agents,codex]" && praxist setup --interactive --install-skills codex
快速启动流程:
- 安装并运行交互式引导配置(OOBE),完成运行时配置、凭证管理、Codex 技能安装
- 阅读 Quickstart 文档,理解项目前提(目标可度量、项目已可运行、最优路径未知)
- 创建任务项目:项目必须包含基线代码和运行基线的本地资源,Praxist 不会自行发明缺失数据或模拟器
- 定义研究简报(Research Brief):明确目标、置信标准、允许资源、探索策略和实际运行预算
- 启动研究:系统自动协调并行研究智能体,按代际积累证据,直到收敛或预算耗尽
Claude Code 模式(备选):
# 使用 Claude Code 作为宿主
codex --yolo
# 然后让 Codex 安装并配置 Praxist
使用场景与人群
适用场景:
- 目标可度量、执行路径未知的长期研发课题(如:火箭回收策略优化、等离子体磁控参数搜索)
- 多假设并行验证需要可审计证据链的研究项目(如:量化交易策略迭代、新药分子筛选)
- 需要在有限预算下持续迭代的 AI 科研工程化项目
目标用户:
- AI 研究人员与 R&D 团队
- 需要自动化实验、基准测试、证据驱动决策的软件工程师
- 对科研可复现性有要求的技术组织
不适用的场景: 目标不可度量、项目尚无法运行、或仅需单次代码生成/问答的短期任务。
输入与输出案例
案例一:火箭回收轨迹优化
- 输入:研究简报——目标为最大化回收成功率,约束为燃料消耗 ≤ 阈值,基线为现有控制策略代码
- 过程:PRAXIST 并行启动多个研究智能体,各自在仿真环境中探索不同控制策略变体,评估器按成功率+燃料消耗加权打分
- 输出:代际演进报告,含每代证据链、最优策略轨迹、验证结果;在 MLE-bench 火箭回收任务上超越任务原生基线
案例二:定量交易策略搜索
- 输入:包含历史行情数据、评估协议(夏普比率、最大回撤)和基线策略代码的任务项目
- 过程:PRAXIST 多代际并行探索策略空间,持久证据库记录每次实验的参数-结果映射,Gems 层保留高夏普比率候选
- 输出:策略演进树(显示哪些设计元素反复带来改进)+ 最终推荐策略包 + 可审计的证据链
评论区
登录后可评论。