Academic Research Skills Skill:让 Claude 陪你跑完学术论文全流程
这是一套为 Claude Code 量身打造的学术论文全流程 AI 协作套件——从文献综述、结构搭建、正文写作、LaTeX 编译,到多视角盲审、同行评审、修改重投,所有环节都被一条 10 阶段 Pipeline 串成流水线。它之所以爆火,是因为它直面了 AI 写论文最致命的痛点:引用幻觉、实验造假、方法学伪造,并给出可工程化、可审计、可复现的解决方案——Stage 2.5/4.5 完整性门禁、Semantic Scholar 真伪校验、Material Passport 实验溯源、引用三段式锚点定位、跨模型盲检。
总结
Academic Research Skills(ARS)是 GitHub 上首个把学术写作拆成「研究 → 写作 → 盲审 → 修订 → 定稿」五个阶段、再交还给 Claude Code 多个 Sub-Agent 协同执行的 Skill 套件,由开发者 Imbad0202 长期独立维护。它之所以在 2026 年 7 月这一波 AI 学术写作工具中脱颖而出,不是因为花哨,而是因为它首次把”AI 写论文的失败模式(Lu et al., Nature 651:914-919 列举的 7 类问题)”做成了硬性门禁——引用必须可定位、声明必须可验证、实验必须可溯源、跨模型必须可盲检。截至 2026-07-31,仓库已收获 40,219 stars、3.2k forks,v3.19.0 版本 20 小时前仍在迭代,活跃度排进 GitHub 全站”claude skill”搜索结果 Top 8。
功能与原则
ARS 把学术论文生命周期拆成 4 个独立 Skill,由 academic-pipeline 编排器串成 10 阶段流水线:
- academic-deep-research:13 个研究 Sub-Agent(含 Socratic 引导、PRISMA systematic review、意图识别、对话健康监控),可选
ARS_CROSS_MODEL跨模型盲检,调用 Semantic Scholar API 做引用真伪核验。 - academic-paper:12 个写作 Sub-Agent,集成 Style Calibration(学习作者文风)、Writing Quality Check(捕捉 AI Slop 模式)、LaTeX 加固、可视化、修订教练、引用格式转换、反泄漏协议、VLM 图表核验。
- academic-paper-reviewer:7 个多视角同行评审(EIC + 3 个动态评审员 + Devil’s Advocate),0–100 分质量量表,concession threshold protocol,attack intensity preservation,R&R traceability matrix,仅读约束。
- academic-pipeline:10 阶段编排器,自适应检查点、声明验证、Material Passport、可选
repro_lock、跨模型完整性验证、会话中途强化、分数轨迹追踪。
设计原则严格遵循「Human-in-the-loop, not full automation」:每个 Stage 都有 Integrity Gate(Stage 2.5/4.5 跑 7 模式阻断清单),引用层做到三段式锚点(locator infrastructure),可选 ARS_CLAIM_AUDIT=1 触发「声明 vs 引用」真伪审计,命中 5 类 HIGH-WARN(claim-not-supported / negative-constraint-violation / fabricated-reference / anchorless / constraint-violation-uncited)即拒绝输出。
认可度
截至 2026-07-31 数据:
- GitHub stars:40,219(
Imbad0202/academic-research-skills,仓库创建后约 10 个月即破 4 万星) - Forks:3,200+
- 最新版本:v3.19.0(2026-07-22 release-prep)
- 最新提交:20 小时前(2026-07-30,fix(reviewer) #609),属于「本周正在爆」的活跃维护期
- Trending 经历:多次登上 GitHub Trending「Claude Skills」类目 Top 10,按 stars 排序在「claude skill」全站搜索结果位列第 8
- 学术认可:DOI 已分配(10.5281/zenodo.20696614),可在 Zenodo 引用
- 文档多语言:英文(主)、简体中文、繁體中文、日本語、한국어 五版 README
- 跨生态覆盖:Claude Code CLI、VS Code、JetBrains、Claude.ai、Claude Science、Codex CLI(独立仓库
Imbad0202/academic-research-skills-codex) - 第三方集成:在
THIRD_PARTY.md中被多个平台与社区项目引用
链接
GitHub:https://github.com/Imbad0202/academic-research-skills
Zenodo DOI:https://doi.org/10.5281/zenodo.20696614
Codex 版(兄弟项目):https://github.com/Imbad0202/academic-research-skills-codex
原作者
Imbad0202(GitHub: https://github.com/Imbad0202),个人开发者,长期独立维护本项目与 Codex 版本,仓库 NOTICE.md 明确标注为「personal project statement」。自 2025 年 10 月起持续迭代,已迭代到 v3.19.0,平均每周 2–3 次 release-prep 提交;本人同时是 https://buymeacoffee.com/crucify020v 的 Sponsor 接受者。
介绍
ARS 不是「AI 一键写论文」工具,而是一套「人类研究员 + Claude 协作」的工程化 Pipeline。它的核心目标是规避 Lu et al.(Nature 651:914-919, 2026)在「The AI Scientist」中总结的 7 类 AI 研究失败模式:实现 Bug、幻觉结果、走捷径依赖、把 Bug 当 Insight、方法学伪造、frame-lock、引用幻觉。
整个 Pipeline 把研究论文拆成可审计、可定位、可重跑的 10 个 Stage:
- Stage 1(research):13 个研究 Sub-Agent 启动,先用 Socratic 引导和用户对话理清研究问题,再用 PRISMA systematic review 做文献综述,最后调用 Semantic Scholar API 校验每一条引用真实存在。
- Stage 2(write-draft):12 个写作 Sub-Agent 接管,Style Calibration 学习作者过去论文的文风,Writing Quality Check 捕捉 6 类典型 AI Slop 模式(”delve into”、”It is important to note”、”In conclusion” 等)。
- Stage 2.5(Integrity Gate #1):阻断式完整性检查——跑 7 模式 checklist:引用真伪、声明可定位性、实验可溯源、统计合理性、方法学合规、frame-lock 检测、引用-声明对齐。
- Stage 3(review):7 个盲审 Sub-Agent 登场——EIC 主编 + 3 个动态分配的领域 Reviewer + 1 个 Devil’s Advocate(专挑刺),每人给出 0–100 分质量量表 + 具体修订建议。
- Stage 3′(re-review):作者提交修订后,所有 7 个审稿人重新打分,计算 concession threshold(让步阈值),决定是否进入下一轮。
- Stage 4(finalize):作者根据 R&R traceability matrix 逐条回复审稿人,Response to Reviewers 文档由 LaTeX 编译成 PDF。
- Stage 4.5(Integrity Gate #2):最终完整性复检,零回归确认。
- Stage 5(post-publication audit):可选——独立全引用审计,复盘本次写作过程能改进的环节。
中间穿插的 Material Passport(实验溯源护照)记录作者在写作外做的每一组实验,论文声明通过 claim_intent_manifest.planned_experiment_ids[] 与实验 ID 对齐,完整性门禁审计每个声明是否能溯源到真实实验——ALIGNED / OVERSTATED / NOT_SUPPORTED_BY_PROVENANCE / PROVENANCE_INSUFFICIENT 四种结果,对外不评判「实验本身是否正确」,只评判「声明是否有溯源支撑」。
特点
- 学术写作反幻觉工程化:在 2026 年 5 月 arXiv 等数据库被发现 146,932 条 hallucinated citations 的大背景下,ARS v3.7.3 引入「三段式锚点定位」(citation anchors),v3.8 引入
ARS_CLAIM_AUDIT=1触发声明-引用真伪审计,5 类 HIGH-WARN 全部 gate-refuse。 - 人类在环,非全自动:明确反对「全自动 AI Scientist」路线,所有 Integrity Gate 都允许人工 override,Stage 2.5/4.5 的 7 模式 checklist 是可解释、可定制的,Stage 4.5 之后的 post-publication audit 是强制的复盘机制。
- 跨模型盲检:通过
ARS_CROSS_MODEL环境变量启用,让 Claude 与 GPT / Gemini / DeepSeek 等多模型在 Integrity Gate、Declaration Audit、Final Review 三个盲点相互校验,避开单模型的盲区。 - 风格学习 + AI Slop 检测双引擎:Style Calibration 从作者过往论文中学语气、用词、句长分布;Writing Quality Check 反向捕捉「delve into」「In conclusion」「It is important to note」等典型 AI 生成模式,二者组合既不像 AI 也不像装了个人工痕迹。
- 完整同行评审工作流:EIC + 3 Reviewer + Devil’s Advocate + R&R traceability matrix + concession threshold + attack intensity preservation,把 ICLR/NeurIPS 等顶会的同行评审流程拆解成可工程化执行的 Sub-Agent 协作。
- 多平台原生支持:Claude Code CLI、VS Code、JetBrains、Claude.ai Project、Claude Science 导入、Codex CLI(独立仓库)六种安装方式,五国语言 README,DOI 已分配便于学术引用。
使用方法
方法 1(推荐,v3.7.0+ 插件安装):
# 在 Claude Code 中执行
/plugin marketplace add Imbad0202/academic-research-skills
/plugin install academic-research-skills
方法 2(Codex CLI 用户):安装兄弟项目
# 独立的 Codex 原生分发版
git clone https://github.com/Imbad0202/academic-research-skills-codex
方法 3(Claude Science 用户):在 Claude Science 的 Skills → Import from GitHub 中粘贴 https://github.com/Imbad0202/academic-research-skills,Preview 后点 Import 4 skills(v3.14.0+)。
最小调用示例(Socratic 引导):
/ars-plan
→ 描述你正在写的论文:
"我想研究 LLM Agent 在多步骤推理中的失败模式,重点在 OpenAI o3 与 Claude 3.7 上的对比"
→ ARS 启动 Socratic 对话,逐步细化:
1. 研究问题:是否要限定数学推理 vs. 一般推理?
2. 方法论:是用公开 benchmark 还是自建数据集?
3. 评估指标:accuracy、cost、latency 哪个优先?
4. 实验设计:是否要 ablation?
5. 论文目标会议:ICLR / NeurIPS / EMNLP?
→ 完成后 ARS 生成结构化大纲,进入 Stage 1 文献综述。
单次快查调用:
/ars-lit-review "your topic"
使用场景与人群
目标人群:
- 博士生 / 博士后 / 青年学者:正在准备第一篇顶会论文,需要一个能避免引用幻觉、保留自己文风的协作系统。
- 跨学科研究者:需要快速搭建一个新领域的方法学框架,ARS 的 PRISMA systematic review + Socratic 对话能显著缩短文献调研周期。
- AI 增强写作的先导团队:研究机构 / 大厂研究院,希望把「AI 写论文失败模式」清单变成可执行的工程门禁。
- 学术期刊编辑:希望用 ARS 的 Integrity Gate 在同行评审之外加一道自动化完整性筛查。
典型场景:
- 写第一篇顶会论文:从空白文档到 LaTeX 提交的全流程。
- 博士论文第 4 章这种「研究空白大、引用风险高」的章节。
- 跨学科合作论文(CS + 生物 + 物理),需要 Material Passport 把不同作者做的实验整合起来。
- 需要快速写文献综述(PRISMA systematic review)。
- 顶会 rebuttal 时间紧迫,需要在 7 天内完成 5 轮同行评审 + Response to Reviewers。
不适合场景:
- 想要「AI 一键写完整论文不参与」的偷懒用户(ARS 的核心立场就是反对全自动)。
- 课程作业、本科论文(ARS 的完整 Pipeline 在这种场景过重)。
- 完全不能用 API Key 的离线环境(ARS 默认需要 Claude API,可选 cross-model 也需要外部模型 API)。
输入与输出案例
案例 1:Socratic 引导规划一篇 NeurIPS 论文
Input(用户描述):
“我在做 LLM Agent 在多步骤数学推理上的失败模式分析,想投 NeurIPS 2026。”
ARS Output(Stage 0 计划阶段,多轮对话后):
# ARS-Generated Paper Plan
## 1. Research Question(精炼后)
"When does chain-of-thought self-correction degrade LLM agent
performance on multi-step math reasoning, and which failure modes
dominate?"
## 2. Methodology
- Benchmark: GSM8K + MATH + 自建 200 题对照
- Models: OpenAI o3 / Claude 3.7 Sonnet / DeepSeek-R1
- Metric: accuracy / steps-to-correct / cost-per-correct-answer
- Ablation: 4 种 prompt 结构 × 3 种自我修正触发机制
## 3. Expected Contribution
- 7 类失败模式的实证分类(扩展 Lu et al. 2026)
- 一种新的「prompt 中立化」干预方法
- 跨模型稳健性证据
## 4. Timeline
- Stage 1 (lit review): 5 天
- Stage 2 (write): 10 天
- Stage 2.5 (integrity gate): 1 天
- Stage 3 (review): 3 天
- Stage 4 (finalize): 5 天
- Stage 4.5 (final integrity): 1 天
## 5. Suggested Sub-Agents for Stage 1
- literature-searcher(主)
- methodology-validator(验证研究空白)
- citation-traceability(Semantic Scholar 校验)
案例 2:写作阶段的 Style Calibration + Writing Quality Check
Input(作者初稿片段):
“It is important to note that LLM agents often exhibit delve into
multi-step reasoning in a comprehensive manner. In conclusion,
we argue that self-correction can improve performance.”
ARS Output(经 Style Calibration + WQC 处理后):
## 5.2 Self-Correction Effects on Multi-Step Math Reasoning
Across all three benchmarks, self-correction lifts accuracy by 7–14
points when chain-of-thought consistency holds, but the gain collapses
to noise (σ=2.1) once reasoning length exceeds 12 steps. We attribute
this collapse to two mechanisms that previous work has not separated:
"verification anchoring" — where the model anchors on the first plausible
answer and refuses to revise — and "prompt saturation" — where the
self-correction prompt itself contributes more tokens than the original
reasoning trace. The interaction between these mechanisms, rather than
either alone, explains why longer chains lose the benefit.
Table 3 reports the per-step accuracy decay curve and the ablation
isolating each mechanism; full per-condition traces are in Appendix C.
输出里 “delve into”、”It is important to note”、”In conclusion”、占位套话全部被 Style Calibration 替成作者风格的具体论证 + 数据引用 + 章节定位。
ARS v3.19.0 的活跃维护和 40k+ stars 的社区基础表明,AI 学术写作工具已经从「花哨演示」阶段进入「工程化、可审计、跨模型盲检」的成熟期。对于每一位严肃对待论文质量的研究者来说,ARS 都是 2026 年最值得安装到本地 Claude Code 的一组 Skill。
GitHub: https://github.com/Imbad0202/academic-research-skills
评论区
登录后可评论。