17.5万科学家在用,163个科学技能让AI真正能跑湿实验:Scientific Agent Skills深度解读

生信、药物研发、临床数据分析——这些领域长期被「AI 能帮忙,但不知道从哪下手」这个问题困住。模型厂商给出的 demo 很惊艳,拿来跑真实课题时,却发现 AI 连 PubMed 检索都不会调、基因表达量分析的正确率还不到 30%。K-Dense 开源的 Scientific Agent Skills(GitHub 34,771 ⭐,自称被全球 175,000+ 科学家使用)试图解决这个问题:不给 AI 模型硬塞更多知识,而是把专业领域的标准操作流程打包成 AI agent 可以直接调用的技能模块。

它到底能做什么

简单说,这是一个 163 个可安装技能的合集,覆盖癌症基因组学、药物靶点预测、分子对接、单细胞 RNA-seq、质谱分析、临床文献检索等 18 个科学领域。每个技能本质上是一个 SKILL.md 文件,里面写清楚了:调用哪个 Python 包、查哪个数据库 API、参数怎么填、结果怎么解读。安装只需一行命令:

npx skills add K-Dense-AI/scientific-agent-skills

Skill 安装完成后,在 Claude Code / Cursor / Codex 等支持的 agent 里直接说「帮我查一下 BRCA1 基因在 TCGA 数据库里的表达情况」,agent 就能加载对应的技能文件,调用正确的 API,把结果整理出来——而不是凭幻觉编一个「BRCA1 在肿瘤组织中高表达」的废话。

Bench 数据:技能加进来和不加,差距有多大

K-Dense 自己在博客里放了几组数据,不是跑分榜那种理想数字:

  • PyOpenMS 质谱分析技能:250 次运行对比,加技能后任务成功率从 96% 提升到 100%,API 调用错误减少 92%,单次分析成本下降约 10%。
  • BixBench 生物信息学基准: Sonnet 级别模型单独跑准确率 65.3%,加上 163 个技能调优后冲到 92.0%。
  • SkillsBench 1.1:跨模型舰队平均提升 +16.6 个百分点。

值得注意的是,这些数据主要在强模型(Sonnet 档)上有意义。弱模型如果不在 prompt 里显式点名技能名称,自动触发率只有 8%——也就是说,指望 AI 自己想起来「我应该加载 rdkit 技能来处理这个分子结构」,在便宜模型上基本不work。

支持哪些 Agent

官网列出的有:Claude Code、Cursor、Codex、Google Antigravity、Pi、NemoClaw、OpenClaw,以及任何支持 Agent Skills 开放标准的客户端。覆盖的数据库包括 PubChem、ChEMBL、UniProt、ClinicalTrials.gov、COSMIC 等 100+ 个,底层调用的 Python 包包括 RDKit、Scanpy、Biopython、PyTorch Lightning、DiffDock 等 70+ 个。GPU 密集型任务(分子动力学、蛋白质结构预测)可以甩给 Modal 处理,不强制本地有卡。

谁适合用

适合:已有一定科学背景、能看懂技能文档的研究者或 AI 工程师;正在用 Claude Code / Cursor 做课题,想把 AI 真正接进湿实验或临床数据分析流程的团队;对药物靶点、基因组学、临床文献检索有实际需求,且愿意显式点名技能名的使用者。

不适合:完全不想接触命令行的纯 Wet Lab 研究者;需要端到端完全自主执行不需要人工核对产出的人(这是 K-Dense Web 付费版做的事,不是这个开源库);Windows 用户没有配 WSL2 的(macOS/Linux 直接装);社科或人文方向研究者(覆盖稀疏,不在主赛道)。

最近更新节奏

v2.64.0 于 2026 年 8 月 17 日发布,大约每 5-7 天一个版本,当前版本 v2.64.0,最近高频更新的是各个技能的 API 适配和安全加固。README 里专门提到了安全扫描 workflow,持续用 Trivy 做依赖漏洞检测——考虑到这些技能会实际执行代码,这块的维护是认真的。

上手建议

第一步,先跑通一个具体任务,而不是让 AI 把所有技能都过一遍。建议从「文献检索」类技能入手:装好之后让 agent 查一篇具体的 PubMed 文献,核对返回的作者、年份、摘要是否正确——这是最小的可信度验证。如果这一步 AI 瞎编,那其他复杂技能也不能信。

第二步,熟悉显式点名技能的语法。弱模型环境下,「use the rdkit skill」比模糊描述「帮我分析这个分子」靠谱得多。

第三步,如果你在做药物发现相关课题,PyOpenMS 和 DiffDock 技能值得关注:前者有 250 次运行的基准数据背书,后者已经被用来做过真实世界的分子对接对比实验(pKa MAE 0.23,logD MAE 1.15)。

GitHub 仓库:https://github.com/K-Dense-AI/scientific-agent-skills

附:K-Dense 官方博客有每项技能的基准报告,地址 https://www.k-dense.ai/blog

评论区

0 条评论

登录后可评论。