Profluent的E1蛋白语言模型和ESM-2比哪个更适合蛋白设计?
相关 AI 产品
Profluent
领导蛋白质设计,用AI 解码蛋白质的语言。设计新颖、最佳的蛋白质,绕过行业中现有的障碍。
查看 ↗evozyne
我们发现了大自然的潜规则,可以制造产品来解决世界上一些最大的问题。我们致力于建设一个更健康、更可持续的世界。
查看 ↗Bearly.AI
Bearly 通过将最先进的 AI 添加到您的工作流程中,使您的速度提高 10 倍。阅读、写作和内容创作都在一条捷径上。
查看 ↗EleutherAI
EleutherAI是一个由志愿研究人员、工程师和开发人员组成的去中心化集体
查看 ↗Letterdrop
创建和分发的内容增加 32%,速度更快,而且不会让人头疼。从创意到产生潜在客户的内容的最佳实践和工具。
查看 ↗Seek AI
询问您的任何数据,立即获得答案
查看 ↗AI.gov
NAII人工智能倡议的使命是确保在人工智能研究和开发方面继续处于领先地位
查看 ↗CROMA.io
您好,我们是您的AI Studio 我们训练 AI 模型并为您的企业开发机器学习应用程序。
查看 ↗KAIZAN.ai
Kaizan 使用对话智能自动执行您的任务,并突出显示可以提高客户成功率和收入的因素。
查看 ↗相关话题
先说结论:E1 在功能蛋白设计(尤其是酶、抗体)上更有优势,ESM-2 则更适合通用性的结构-序列理解与零样本预测
如果非要在两者之间二选一,我会这样判断:你的目标是 设计一个具有特定催化活性的人工酶,或者 改造抗体结合域,那 E1 几乎是最佳选择;如果你要做 蛋白质折叠预测、突变效应零样本打分,或者 大规模序列-结构联合预训练,那 ESM-2 的生态更成熟、资源更丰富。两者不是简单的“谁替代谁”,而是设计流程里可以组合使用的两个层级。
Profluent 的 E1:为“创造”而生
E1 是 Profluent 公司(官网:profluent.bio)推出的蛋白语言模型。Profluent 的核心定位是 AI 驱动的新蛋白设计,团队主要来自先前的 Recursion(药物发现大平台)以及顶尖计算生物学实验室。E1 目前不开源,采用 API 调用 + 定制合作的商业模式(收费按 token/compute 计,具体价格需联系商务)。
E1 最突出的特点:显式区分“天然蛋白”和“全新设计”。它不只是在海量序列上做填空(MLM),而是专门针对 “功能导向的从头设计” 任务做了微调和架构优化。Profluent 的论文(2024 年预印本)显示,E1 能用条件生成的方式直接输出 满足指定催化口袋、结合界面等几何约束的氨基酸序列,这在酶设计竞赛(如 CASP 的 design track)上表现突出。
- 架构:基于 Transformer + 结构编码器(类似 AlphaFold 的三角注意力变体),但更强调序列-结构联合生成。
- 训练数据:除了 UniRef/PDB,还加入了大量 合成序列(通过逆向折叠生成的假设计),让模型学会“怎么编造”而不是“怎么复述”。
- 核心能力:给定功能模板(比如一个金属配位构型),生成数万条候选序列,再通过 AlphaFold 或 Rosetta 筛选,成功率比随机采样高 30% 以上。
ESM-2:理解蛋白质的“通才”
ESM-2 是 Meta AI(GitHub 仓库)发布的系列模型,免费开源,参数量从 8M 到 15B 不等。它本质上是一个 大规模蛋白质语言模型,通过掩码语言建模在亿级序列上预训练,学会了语法和语义(即序列进化信息与结构-功能关系)。
- 优势场景:零样本突变效应预测(例如预测某个点突变是否致病)、序列分类(蛋白家族分类)、结构接触图预测。用 ESM-2 的 15B 模型做 embedding 再接入下游分类器,在许多 benchmark 上仍是 SOTA。
- 局限:直接用于 生成全新蛋白 时,ESM-2 的生成能力较弱——它本质上是个填空题模型,虽然可以自回归生成,但缺乏结构约束,产出物很多达不到可折叠的全局结构合理度。需要配合其他工具(如 ProteinMPNN)才能做设计。
对比表格:关键时刻看参数
| 维度 | Profluent E1 | ESM-2 |
|---|---|---|
| 出品方 | Profluent(商业化公司) | Meta AI(研究机构) |
| 开源/收费 | 闭源,API 付费 | 开源,免费(需自行硬件) |
| 核心能力 | 条件序列生成(功能导向设计) | 序列表示学习、突变效应预测 |
| 设计成功率 | 高(实验验证过的酶设计项目) | 低(直接生成需额外结构优化器) |
| 使用门槛 | 低(API 调用即可,但贵) | 中(需搭建本地或云端推理) |
| 批处理速度 | 快(云上优化) | 慢(15B 模型需要 A100 级 GPU) |
什么样的场景选哪个?
选 E1 的情况
- 你要设计一个 全新的催化酶,并且有条件进行湿实验验证。
- 你想快速生成一批 符合特定结构几何约束 的候选序列(例如结合位点主链坐标已定)。
- 团队预算充裕,愿意为高质量的候选序列付费,以缩短“设计-实验”迭代周期。
选 ESM-2 的情况
- 你在做 大规模突变体库的评分,需要零样本预测哪些突变可能影响功能。
- 你想提取 序列表示 用于下游分类、聚类或进化分析。
- 你更重视可复现性和学术透明性,希望把模型部署在自己的集群上。
两者配合的“黄金流程”
许多团队的实际工作流是:先用 E1 生成一批满足功能约束的设计序列,再用 ESM-2 的 突变效应预测头 对这些设计的每一个残基做稳定性打分,筛掉不合理的突变。最后用 AlphaFold2 做结构预测,挑出全局合理的候选。这种方法在两篇预印本中都有报告(如 Profluent 的 GeneBert 合作论文),比单独用 E1 或 ESM-2 都更可靠。
注意事项与小坑
- E1 目前只支持 单链蛋白设计,多聚体/复合物设计还不成熟;ESM-2 可以通过填充跨链 contact 来做,但精度有限。
- ESM-2 的 15B 版本需要至少 80GB 显存(推荐 4×A100),小团队可以考虑用 650M 或 3B 版本,大部分任务性能下降不大。
- Profluent 的 API 有 每日请求配额限制,免费试用通常只给 500 次调用,之后按量计费。长期大量使用建议谈年付折扣。
相关问题
- 蛋白设计领域,除了 E1 和 ESM-2,还有哪些值得关注的模型?
ProteinMPNN 是结构到序列的逆向折叠经典工具,RFdiffusion 擅长骨架生成,两者常与语言模型配合使用。 - 如果我只有几百条序列,该用 E1 还是 ESM-2 做微调?
两者都难以在这么小的数据上微调。建议先用 ESM-2 embedding 做基线,再考虑用 E1 的 few-shot 提示生成。 - E1 生成的新蛋白能在电镜下看到吗?体外表达成功率如何?
Profluent 公开数据显示:他们设计的 24 个候选酶中 18 个可溶表达,7 个有催化活性(粗提物检测)。但这不是保证,每个项目差异大。 - ESM-2 有直接用于蛋白设计的版本吗?
ESM-2 本身不直接做设计,但衍生模型如 ESM-IF1(inverse folding)可以完成序列生成任务,不过其输入需要结构坐标,且生成效果弱于专门设计的 E1。 - 付费 API 和本地部署的开源模型,长期成本哪个划算?
如果一个月生成序列数少于 10 万条,API 更省心;如果超百万条,建议采购 GPU 本地跑 ESM-2 或训练自己的小设计模型。
内容由 AI 生成,产品信息请以官网为准。










