
Boltz-2 生物分子相互作用与亲和力预测从安装到首次预测的完整指南【免费下载链接】boltzOfficial repository for the Boltz biomolecular interaction models项目地址: https://gitcode.com/GitHub_Trending/bo/boltzBoltz-2 是一个开源的生物分子相互作用预测模型能同时输出蛋白质-配体复合物的三维结构和结合亲和力log10 IC50。它面向药物发现团队把原本需要物理模拟算数天甚至数周的亲和力评估压缩到分钟级代码与权重采用 MIT 协议可自由用于学术和商业场景。对刚接触它的用户本文给出一条最短路径装好环境、跑通仓库自带的亲和力示例、看懂输出 JSON再按需调参。快速上手3 步跑通首次预测官方推荐用 PyPI 安装pip install boltz[cuda] -U也可以直接克隆仓库安装以获取每日更新。仓库自带examples/affinity.yaml示例包含一条蛋白质序列、一个小分子 SMILES以及properties中的affinity: binder: B配置正好可以当首次运行的输入git clone https://gitcode.com/GitHub_Trending/bo/boltz cd boltz pip install -e .[cuda] boltz predict examples/affinity.yaml --use_msa_server环境要求 Python 3.10~3.12建议配 NVIDIA GPUCPU 模式明显更慢。首次运行会自动从 Hugging Face 下载模型权重之后走本地缓存。跑完后结果落在以输入文件命名的目录下predictions/里有预测结构.cif带 per-token pLDDT、confidence_*.json含 confidence_score、iptm、complex_plddt 等打分、以及开启亲和力后的affinity_*.json。亲和力 JSON 里有两个关键字段affinity_pred_value是 log10(IC50)IC50 以 μM 计数值越小结合越强例如输出 0 对应 10⁻⁶ Maffinity_probability_binary是 0~1 的结合概率。前者用于比较已知活性分子之间的强弱后者用于区分结合物与非结合物。换算提示pIC50(kcal/mol) (6 - y) × 1.364y 为模型输出。原理速览Boltz-2 的核心架构是 ESM 风格的编码器加结构扩散模型。蛋白质序列和 MSA多序列比对先被编码成语义特征配体则通过 CCD 数据库或 SMILES 解析成原子图特征两者一起送入扩散过程逐步去噪出复合物的原子坐标。可以把 MSA 理解为进化的上下文同家族蛋白哪些位置保守、哪些可变直接暗示了结合口袋的形态这也是为什么蛋白质输入默认要求提供 MSA。亲和力预测挂在结构预测之上但用了独立的输出头一个头输出结合概率二分类监督训练目标是把 binder 和 decoy 分开另一个头输出 log10(IC50) 回归值目标是捕捉小结构改动引起的亲和力变化。两个头训练数据不同、监督方式不同官方建议分开使用而不是混着解读。结构预测部分 Boltz-2 把 AlphaFold3 的注意力主干 扩散采样流程做了开源化实现默认 3 轮 recycling、200 步采样、1 个样本需要更高精度时可以按 AlphaFold3 的标准配置加到 10 轮 recycling、25 个样本代价是时间成倍增加。在 GPU 上 Boltz 还会调用 NVIDIA cuEquivariance 加速核老卡上可关掉换稳定性。实战场景四种典型用法场景一化合物库虚拟筛选。输入一个目录Boltz 会批量处理其中所有 YAML 文件用affinity_probability_binary做过滤按概率排序保留头部分子进入实验验证。筛选阶段只关心是否结合所以用概率值而不是回归值。场景二先导化合物优化。对同一靶点的 10~20 个结构类似物各跑一次预测比较affinity_pred_value的相对变化来指导下一轮改造。注意该字段只在活性分子之间比较才有意义不要拿它去筛 inactive。场景三已知结合口袋的结构预测。在 YAML 的constraints段加pocket约束指定 binder 链和口袋残基编号contacts用 [链ID, 残基序号] 列表把预测限制在真实结合位点附近。参考仓库里的examples/pocket.yaml。场景四大环/肽类分子筛选。加上--affinity_mw_correction对分子量做校正避免大小分子之间因分子量差异不公平比较。配体硬上限 128 个重原子RDKit RemoveHs 后官方建议不要显著超过 56 个。采样参数速查参数作用推荐值适用场景--use_msa_server自动经 mmseqs2 服务器生成 MSA开启没有预先算好的 MSA 时--diffusion_samples_affinity亲和力扩散采样次数5刚性靶点/ 10柔性靶点提高亲和力结果稳定性--sampling_steps_affinity亲和力每样本扩散步数200默认即可显存紧张时下调--diffusion_samples结构预测采样数1默认/ 25高精度需要高置信结构时--no_kernels禁用 cuEquivariance 加速核关闭老款 NVIDIA GPU 报错时更多输入格式细节模板、共价键、contact 约束、MSA 服务器鉴权见 docs/prediction.md。效果验证benchmark 数字官方在 FEP、CASP16 等基准上报告了亲和力性能。FEP 4 targets 上 Boltz-2 的 Pearson 相关系数为 0.66与 OpenFE 持平高于 GAT0.40和 MM/PBSA0.19略低于参考方法 FEP/ABFE0.78/0.75CASP16 上 Boltz-2 达到 0.65高于 GAT 的 0.50 和 VncDeep 的 0.47。官方表述Boltz-2 是首个逼近物理自由能微扰FEP精度、同时快约 1000 倍的深度学习模型这正是in silico 筛选可行的关键。结构预测方面含 Boltz-1/2x 全家族测试集 Intra-Protein lDDT 上 Boltz-2 为 0.86与 AF3 的 0.87 基本持平Physics Validity 上 Boltz-2 达 0.97明显高于 AF3 的 0.39说明预测结构的物理合理性更好。Ligand-Protein lDDT 上 Boltz-2 为 0.59与 Boltz-1 一致低于 AF3 的 0.75——配体口袋精度仍有提升空间这是选型时需要知道的边界。常见报错与参数避坑Q老 GPU 上报 cuEquivariance 相关错误加--no_kernels关闭加速核即可正常运行速度略降。这是官方给出的标准解法。Q提示缺 MSA但我没打算做 MSA蛋白质输入默认要求 MSA。要么加--use_msa_server自动生成要么在 YAML 里写msa: path/to/file.a3m。msa: empty单序列模式虽然支持但会降低精度官方不建议。Qaffinity_pred_value 和 probability_binary 用哪个筛选活性分子用 probability0~1区分 binder/decoy比较已知活性分子之间的亲和力强弱用 pred_valuelog10 IC50越小越强。两者训练目标和监督信号不同不要交叉解读。Q两次运行结果不一致扩散采样本身带随机性。提高--diffusion_samples_affinity如 5→10可获得更稳的结果另外注意输出目录默认复用缓存改了参数重跑要加--override。Q显存不够下调--sampling_steps_affinity和--max_parallel_samples或减少并行设备--devicesCPU 只能当验证环境用别用于批量任务。总结Boltz-2 把结构预测和亲和力预测整合进同一个开源模型用 MIT 协议向社区开放是早期药物发现里做 in silico 筛选和先导优化的实用工具。它的适用边界也很清楚亲和力目前只支持小分子对蛋白质对 RNA/DNA 靶点结果不可靠配体建议不超过 56 个重原子配体口袋精度尚不及头部闭源模型。选对场景、看对字段它能把原来数周的评估流程压缩到一次下班前的等待时间。【免费下载链接】boltzOfficial repository for the Boltz biomolecular interaction models项目地址: https://gitcode.com/GitHub_Trending/bo/boltz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考