
Boltz-2 生物分子亲和力预测指南比物理模拟快 1000 倍的完整入门教程【免费下载链接】boltzOfficial repository for the Boltz biomolecular interaction models项目地址: https://gitcode.com/GitHub_Trending/bo/boltz假设你要给一个激酶靶点初筛几十万个小分子。用传统分子对接跑全库GPU 集群可能排队两周费用以万美元计而物理模拟的精度金标准自由能微扰FEP可以理解为用热力学公式硬算结合强度一次模拟就要等很久。Boltz-2 想干的事是让开源模型同时输出复合物三维结构和结合亲和力而且官方给出的速度比 FEP 快 1000 倍。对药物研发早期的虚拟筛选来说这就意味着算得动、算得起。先看证据官方测试里的 Pearson 相关系数是多少 值不值得试先看数字。Boltz-2 官方在三个亲和力基准集上报告了预测值与实验值的 Pearson 相关系数越接近 1 越准FEP 4 targetsBoltz-2 达到0.66与专业物理模拟方法 OpenFE0.66持平高于 ABFE0.75 为另一组设定下的参考之外的各机器学习模型GAT 0.40、ChemGauss4 0.26、BACPI 0.12FEP OpenFE 8 个内部靶点Boltz-2 为 0.62OpenFE 0.63两者基本打平CASP16Boltz-2 以 0.65 领先对比方法中的第二名0.54。再看结构预测侧的官方测试集汇总覆盖蛋白-蛋白、蛋白-DNA、蛋白-RNA、配体等多类复合物一句话总结结构上Boltz-2 与 AlphaFold3、Chai-1 处于同一水平带亲和力上它把深度学习模型这一档的精度拉到了与重型物理模拟可比的位置而代价是几分钟级的运行时间。三步跑通安装 Boltz-2 并跑第一条预测第 1 步克隆并安装git clone https://gitcode.com/GitHub_Trending/bo/boltz cd boltz pip install -e .[cuda]新手注意有 NVIDIA 显卡就装[cuda]版本没有 GPU 把[cuda]去掉装 CPU 版但官方明确 CPU 会慢得多官方建议在全新的 Python 环境里安装避免依赖冲突首次运行会自动下载约 2GB 的预训练权重放在~/.boltz缓存目录。第 2 步写一个 YAML 输入文件输入文件就是一张配方单列出复合物里每条链并声明要预测什么属性。examples/affinity.yaml 就是一个完整模板最小结构长这样sequences: - protein: id: A sequence: 蛋白质序列 - ligand: id: B smiles: CC(O)O properties: - affinity: binder: B新手注意配体用smiles描述分子连接方式的字符串化合物库里可直接复制或ccd码二选一蛋白质不用手写比对文件下一步的--use_msa_server会在线自动生成 MSA多序列比对相当于告诉模型这条序列有哪些进化亲戚目前亲和力预测仅支持小分子配体 蛋白质靶点且官方建议配体不超过 56 个原子超过 128 会直接报错更多输入写法约束、模板、环肽等见 docs/prediction.md。第 3 步一行命令执行预测boltz predict affinity.yaml --use_msa_server --diffusion_samples_affinity 5新手注意--use_msa_server让程序自动在线生成比对缺了它就必须自己提供 MSA--diffusion_samples_affinity 5表示亲和力做 5 次采样后取集成这是官方默认值先用默认值跑通即可输出写在predictions/下结构.cif文件与affinity_*.json、confidence_*.json按输入文件归档改过输入重跑时加--override避免读缓存。看懂结果三个关键字段各管什么 预测结束后重点看两个 JSON。affinity_*.json里有两个核心数字confidence_*.json里有一个结构分数字段含义白话适用场景affinity_probability_binary0–1 的概率这个分子是结合者的可能性多大相当于初筛的开关虚拟筛选、区分结合者与诱饵分子affinity_pred_value预测的 log10(IC50)IC50 以 μM 计数值越低结合越强如 -3 对应 IC5010⁻³ μM属强结合hit-to-lead、先导优化阶段比较活性分子间的相对亲和力confidence_score0–1结构预测的整体置信度0.8·pLDDT 0.2·ipTM 的加权pLDDT 衡量每个残基摆得准不准判断这条预测值不值得信实战建议两个亲和力数字来自不同训练集、不同监督信号官方建议按阶段分开用初筛用概率优化用数值不要混着比大小经验用法先按affinity_probability_binary卡阈值如 ≥0.5做第一轮过滤再对留下的分子按affinity_pred_value升序排序排优先级结构置信度偏低confidence_score大约低于 0.6时先用--use_potentials或增加--diffusion_samples重跑再下结论affinity_pred_value只在比较都已结合的分子之间才有意义拿它去排非活性分子没有参考价值。参数进阶采样次数怎么调、分子量校正何时开 ⚙️分子量校正库内分子大小差异悬殊时比如肽段和小分子混筛加上--affinity_mw_correction参数。它把分子量本身对亲和力的影响单独校正掉让不同大小的分子在同一尺度上可比——好比比赛前先把选手的体重归一化。采样次数按靶点柔性调--diffusion_samples_affinity控制采样轮数--sampling_steps_affinity控制每轮细化步数默认 200。经验法则刚性靶点如激酶用默认 5 次采样就稳定柔性大的靶点如 GPCR建议提到 10–15 次必要时同步加大步数用更多样本换更稳的集成结果。多任务预测Boltz-2 是一个基础模型同一套架构同时承担结构预测与亲和力预测。一次boltz predict会同时产出结构.cif与亲和力 JSON不写properties.affinity时它照样能预测蛋白-蛋白、蛋白-DNA、蛋白-RNA 复合物结构。所以先验证结构合不合理再看亲和力是同一份输出里就能完成的两步。Boltz-2 适合药物研发早筛团队、结构生物学研究者以及想用 GPU 快速给化合物库打分的人。下一步把examples/里的affinity.yaml换成你自己的靶点和分子跑通第一条预测再对照上文三个字段建立自己的筛选阈值。【免费下载链接】boltzOfficial repository for the Boltz biomolecular interaction models项目地址: https://gitcode.com/GitHub_Trending/bo/boltz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考