Build Therapeutic ML Workflows with PyTDC

## 技能简介 PyTDC(Therapeutic Data Commons)是一个面向治疗机器学习领域的开源数据平台

AI编程开发 部分免费

技能简介

PyTDC(Therapeutic Data Commons)是一个面向治疗机器学习领域的开源数据平台,汇聚了药物发现和分子研究中最常用的精选数据集。davila7/pytdc 这款 Skill 将 PyTDC 的能力封装为一组结构化指引,帮助 AI 编程助手为计算化学家、生物信息学研究者和药物发现工程师构建完整的治疗机器学习工作流。

在实际项目中,治疗机器学习(Therapeutic ML)往往面临数据集质量参差、评测协议不统一、分子生成结果缺乏系统性评估等挑战。PyTDC 提供了从数据加载、划分策略、多靶点评测到分子 oracle 打分的全链路支持,而这款 Skill 则让 AI 助手能够在每个环节给出精准的决策建议——从选哪个数据集、到用哪种划分策略、再到如何解读 oracle 评分。

核心能力

  • 任务类型覆盖:支持 ADME(吸收、分布、代谢、排泄)属性预测、药物-靶点相互作用(DTI)、药物-药物相互作用(DDI)、分子生成和毒性预测等多种任务类型。
  • 科学划分策略:不仅支持随机划分,还提供 Scaffold Split(按分子骨架)、Cold-Drug Split(冷药)、Cold-Target Split(冷靶)和时间划分等多种贴近真实评测场景的划分方式。
  • 五种子标准评测:提供五种子实验的标准评测协议,输出均值和标准差,保证结果可复现且具有统计意义。
  • 分子 Oracle 评分:内置 QED(类药性)、SA(合成可及性)、LogP(脂溶性)、DRD2、GSK3β、JNK3 等多种分子 oracle,支持多目标加权评分和约束过滤。
  • 数据处理工具:提供分子格式转换、过滤、负采样和生物医药标识符检索等实用工具,覆盖从原始数据到模型输入的全流程。

安装配置

  • 前提条件:需要 Python 3.8+ 环境,建议配合 conda 或 venv 使用。
  • 安装命令:运行 npx skillstore add davila7/pytdc 完成 Skill 安装。
  • 依赖安装:Skill 安装后需另行安装 PyTDC 核心库(pip install PyTDC)及可选的科学计算依赖(如 rdkit、deepchem)。
  • 验证安装:安装完成后可运行 python -c "from tdc import admet_evaluator; print('OK')" 确认 PyTDC 可用。
  • 更新 Skill:运行 npx skillstore update davila7/pytdc 获取最新版本。

使用步骤

  1. 描述任务目标:向 AI 助手说明你想解决的治疗 ML 问题,例如"我想预测分子的 Caco-2 渗透性"。
  2. 加载数据集:AI 助手根据任务类型推荐合适的 PyTDC 数据集,说明数据的列结构、任务类型和适用的评测指标。
  3. 选择划分策略:AI 助手比较随机划分、Scaffold 划分和冷启动划分的适用场景,推荐最接近实际应用需求的方案。
  4. 设计评测协议:AI 助手帮助制定包含五个随机种子的基准评测计划,明确评测指标、汇总方式和结果报告规范。
  5. 分子生成与评分(如适用):若涉及分子生成任务,AI 助手设计多目标优化工作流,定义 oracle 权重、约束条件和候选分子排序逻辑。
  6. 解读结果与下一步:AI 助手输出评测结果摘要,并指出哪些 oracle 分数需要湿实验验证。

适用场景

  • ADMET 属性预测:评估候选分子的吸收、分布、代谢、排泄和毒性特性,辅助早期药物筛选。
  • 药物-靶点相互作用建模:构建预测化合物与蛋白质靶点结合活性的模型,支撑靶点发现和验证。
  • 分子从头生成:利用生成模型设计满足多目标约束的新分子,并按 drug-likeness 和合成可及性排序。
  • 药物-药物相互作用预测:识别联合用药物之间可能出现的相互作用,支持临床用药安全评估。
  • 毒性预测与风险评估:对候选化合物进行多类别毒性预测,支持安全性评估和优先排序决策。
  • 学术研究与论文复现:利用 PyTDC 提供的标准化数据集和评测协议,保证研究结果的可复现性。

适用人群

  • 计算化学家和药物化学研究者,需要系统性地评测分子属性预测模型。
  • 生物信息学和药物发现方向的研究生,利用 PyTDC 数据集开展课题研究。
  • AI 药物发现初创企业的算法工程师,搭建标准化模型评测流程。
  • 对治疗机器学习感兴趣的数据科学家,快速上手药物数据处理和建模工作流。

工作原理

PyTDC 治疗机器学习工作流的核心逻辑是将 AI 助手的能力与 PyTDC 的结构化数据接口对接。PyTDC 将药物发现领域的原始数据(如分子 SMILES 结构、生物活性测量值)封装为标准化的任务类和数据集对象,并提供统一的评估器接口。Skill 则通过预定义的提示模板,引导 AI 助手在每个工作流阶段做出正确决策:选择哪个任务类、数据集如何加载和划分、评测指标如何选择和报告、多目标 oracle 如何加权组合。最终输出的不是模型权重,而是经过科学设计的实验方案和结果解读建议。

官方链接

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论