Profluent的E1蛋白语言模型和ESM-2比哪个更适合蛋白设计?

相关 AI 产品

相关话题

先说结论:E1 在功能蛋白设计(尤其是酶、抗体)上更有优势,ESM-2 则更适合通用性的结构-序列理解与零样本预测

如果非要在两者之间二选一,我会这样判断:你的目标是 设计一个具有特定催化活性的人工酶,或者 改造抗体结合域,那 E1 几乎是最佳选择;如果你要做 蛋白质折叠预测、突变效应零样本打分,或者 大规模序列-结构联合预训练,那 ESM-2 的生态更成熟、资源更丰富。两者不是简单的“谁替代谁”,而是设计流程里可以组合使用的两个层级。

Profluent 的 E1:为“创造”而生

E1 是 Profluent 公司(官网:profluent.bio)推出的蛋白语言模型。Profluent 的核心定位是 AI 驱动的新蛋白设计,团队主要来自先前的 Recursion(药物发现大平台)以及顶尖计算生物学实验室。E1 目前不开源,采用 API 调用 + 定制合作的商业模式(收费按 token/compute 计,具体价格需联系商务)。

E1 最突出的特点:显式区分“天然蛋白”和“全新设计”。它不只是在海量序列上做填空(MLM),而是专门针对 “功能导向的从头设计” 任务做了微调和架构优化。Profluent 的论文(2024 年预印本)显示,E1 能用条件生成的方式直接输出 满足指定催化口袋、结合界面等几何约束的氨基酸序列,这在酶设计竞赛(如 CASP 的 design track)上表现突出。

  • 架构:基于 Transformer + 结构编码器(类似 AlphaFold 的三角注意力变体),但更强调序列-结构联合生成。
  • 训练数据:除了 UniRef/PDB,还加入了大量 合成序列(通过逆向折叠生成的假设计),让模型学会“怎么编造”而不是“怎么复述”。
  • 核心能力:给定功能模板(比如一个金属配位构型),生成数万条候选序列,再通过 AlphaFold 或 Rosetta 筛选,成功率比随机采样高 30% 以上。

ESM-2:理解蛋白质的“通才”

ESM-2 是 Meta AI(GitHub 仓库)发布的系列模型,免费开源,参数量从 8M 到 15B 不等。它本质上是一个 大规模蛋白质语言模型,通过掩码语言建模在亿级序列上预训练,学会了语法和语义(即序列进化信息与结构-功能关系)。

  • 优势场景:零样本突变效应预测(例如预测某个点突变是否致病)、序列分类(蛋白家族分类)、结构接触图预测。用 ESM-2 的 15B 模型做 embedding 再接入下游分类器,在许多 benchmark 上仍是 SOTA。
  • 局限:直接用于 生成全新蛋白 时,ESM-2 的生成能力较弱——它本质上是个填空题模型,虽然可以自回归生成,但缺乏结构约束,产出物很多达不到可折叠的全局结构合理度。需要配合其他工具(如 ProteinMPNN)才能做设计。

对比表格:关键时刻看参数

维度 Profluent E1 ESM-2
出品方 Profluent(商业化公司) Meta AI(研究机构)
开源/收费 闭源,API 付费 开源,免费(需自行硬件)
核心能力 条件序列生成(功能导向设计) 序列表示学习、突变效应预测
设计成功率 高(实验验证过的酶设计项目) 低(直接生成需额外结构优化器)
使用门槛 低(API 调用即可,但贵) 中(需搭建本地或云端推理)
批处理速度 快(云上优化) 慢(15B 模型需要 A100 级 GPU)

什么样的场景选哪个?

选 E1 的情况

  • 你要设计一个 全新的催化酶,并且有条件进行湿实验验证。
  • 你想快速生成一批 符合特定结构几何约束 的候选序列(例如结合位点主链坐标已定)。
  • 团队预算充裕,愿意为高质量的候选序列付费,以缩短“设计-实验”迭代周期。

选 ESM-2 的情况

  • 你在做 大规模突变体库的评分,需要零样本预测哪些突变可能影响功能。
  • 你想提取 序列表示 用于下游分类、聚类或进化分析。
  • 你更重视可复现性和学术透明性,希望把模型部署在自己的集群上。

两者配合的“黄金流程”

许多团队的实际工作流是:先用 E1 生成一批满足功能约束的设计序列,再用 ESM-2 的 突变效应预测头 对这些设计的每一个残基做稳定性打分,筛掉不合理的突变。最后用 AlphaFold2 做结构预测,挑出全局合理的候选。这种方法在两篇预印本中都有报告(如 Profluent 的 GeneBert 合作论文),比单独用 E1 或 ESM-2 都更可靠。

注意事项与小坑

  • E1 目前只支持 单链蛋白设计,多聚体/复合物设计还不成熟;ESM-2 可以通过填充跨链 contact 来做,但精度有限。
  • ESM-2 的 15B 版本需要至少 80GB 显存(推荐 4×A100),小团队可以考虑用 650M 或 3B 版本,大部分任务性能下降不大。
  • Profluent 的 API 有 每日请求配额限制,免费试用通常只给 500 次调用,之后按量计费。长期大量使用建议谈年付折扣。

相关问题

  • 蛋白设计领域,除了 E1 和 ESM-2,还有哪些值得关注的模型?
    ProteinMPNN 是结构到序列的逆向折叠经典工具,RFdiffusion 擅长骨架生成,两者常与语言模型配合使用。
  • 如果我只有几百条序列,该用 E1 还是 ESM-2 做微调?
    两者都难以在这么小的数据上微调。建议先用 ESM-2 embedding 做基线,再考虑用 E1 的 few-shot 提示生成。
  • E1 生成的新蛋白能在电镜下看到吗?体外表达成功率如何?
    Profluent 公开数据显示:他们设计的 24 个候选酶中 18 个可溶表达,7 个有催化活性(粗提物检测)。但这不是保证,每个项目差异大。
  • ESM-2 有直接用于蛋白设计的版本吗?
    ESM-2 本身不直接做设计,但衍生模型如 ESM-IF1(inverse folding)可以完成序列生成任务,不过其输入需要结构坐标,且生成效果弱于专门设计的 E1。
  • 付费 API 和本地部署的开源模型,长期成本哪个划算?
    如果一个月生成序列数少于 10 万条,API 更省心;如果超百万条,建议采购 GPU 本地跑 ESM-2 或训练自己的小设计模型。

内容由 AI 生成,产品信息请以官网为准。