尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Boltz 亲和力预测实战:一条命令跑通,两个数字筛出候选分子

Boltz 亲和力预测实战:一条命令跑通,两个数字筛出候选分子 Boltz 亲和力预测实战一条命令跑通两个数字筛出候选分子【免费下载链接】boltzOfficial repository for the Boltz biomolecular interaction models项目地址: https://gitcode.com/GitHub_Trending/bo/boltzBoltzBoltz-2开源项目的亲和力预测模块一次运行会同时给出两个数0–1 的结合概率和以 log10(IC50) 表示的亲和力数值。前者决定一个分子值不值得留下后者决定下一步该怎么改。本文按先跑通一次 → 看懂两个数 → 设筛选阈值 → 做优化迭代的顺序展开读完可以直接照着做。 先跑通输入文件怎么写一条命令出结果Boltz 通过 pip 安装后即可使用模型权重在首次运行时自动下载到本地缓存。整个预测流程只需要一个 YAML 输入文件和一条命令行。输入文件怎么写输入文件的核心是三样东西一条蛋白质链、一条配体链、一个属性声明。sequences: - protein: id: A sequence: MVTPEGN... # 此处填写完整氨基酸序列 msa: ./examples/msa/seq1.a3m - ligand: id: B smiles: NCHcc1)C(O)O properties: - affinity: binder: B蛋白质链给出id和氨基酸序列msa指向该蛋白的多序列比对文件用在线服务自动生成时可以省略配体链给出id和 SMILES 字符串也可以改用ccd码引用化合物数据库里的标准配体。properties下的affinity块只写一行binder指向要做亲和力预测的配体链 ID一个文件里只能指定一个小分子。仓库里提供了可直接运行的示例examples/affinity.yaml完整字段说明多链、修饰残基、模板结构、口袋约束等见 docs/prediction.md。一条命令跑预测boltz predict examples/affinity.yaml --use_msa_server --diffusion_samples_affinity 5 --output_format pdb参数逐个看--use_msa_serverMSA多序列比对是把蛋白的同源序列排齐后的产物给模型提供进化信息。带上这个开关Boltz 会通过在线服务自动检索生成不带就需要自己准备好.a3m文件写进msa字段。--diffusion_samples_affinity扩散采样的次数。扩散采样可以理解为模型从一团噪声开始逐步去噪、精修出一个三维构象的生成过程亲和力预测默认采样 5 次次数越多统计量越稳。--sampling_steps_affinity每个样本内部的去噪步数默认 200步数越多结构越精细运行也越慢。--output_format pdb预测出的蛋白-配体复合物以 PDB 格式写出默认是 MMCIF之后可以丢进 PyMOL 等可视化工具里检查结合姿态。结果文件长什么样运行结束后输出目录的predictions/输入文件名/下会生成affinity_输入文件名.json亲和力结果就在里面{ affinity_pred_value: 0.8367, affinity_probability_binary: 0.8425, affinity_pred_value1: 0.8225, affinity_probability_binary1: 0.0, affinity_pred_value2: 0.8225, affinity_probability_binary2: 0.8402 }没有后缀的两个字段是双模型集成ensemble的汇总结果带_1、_2的是集成中第 1、第 2 个模型各自的输出。如果某个成员明显偏离汇总值——比如上面第 1 个模型的概率是 0第 2 个是 0.84——说明模型对这个化合物意见不统一可以把它当作可信度偏低的提示。日常使用一般直接看无后缀的汇总字段。看懂两个数一个是是否题一个是刻度尺这两个数来自训练数据和监督信号都不同的两个预测头各自回答的问题不一样affinity_probability_binary结合概率0–1 之间是模型认为这个配体是活性结合物的概率。它只回答是或否像流水线上的合格/不合格闸门适合大规模判别不管分子结合得多紧。affinity_pred_value亲和力数值单位是 log10(IC50)IC50 按 μM 计算。IC50 指达到一半结合效应所需的配体浓度——数值越小说明药量需求越低、结合越紧。取 log10 是为了把动态范围压平方便处理输出-3对应 IC50 约 10⁻⁶ μM即 10⁻⁹ M强结合物输出0对应 IC50 约 1 μM中等结合物输出2对应 IC50 约 100 μM弱结合物基本是诱饵水平。数字越小预测结合越强。⚠️ 一个常见误用这个数值只在不同活性分子之间比较相对强弱时才有意义拿它去区分活性与非活性并不可靠——那是概率字段的任务。想和实验测定值直接对照可以用下面的公式换算成 pIC50kcal/mol 单位的能量值数值越大亲和力越强pIC50 (6 − affinity_pred_value) × 1.364 虚拟筛选怎么设阈值用概率从大库挑苗子虚拟筛选的任务是从百万级的化合物库里挑出少数几个值得进湿实验的候选。流程很直接为库里每个化合物准备一份 YAML 输入批量跑预测只记录每个分子的affinity_probability_binary阈值分两轮第一轮用约 0.5 的低阈值粗筛宁可多留、怕漏真阳性第二轮对幸存者收紧到 0.7–0.8留得越少进实验的把握越大。也可以不切阈值直接按概率从高到低排序取 Top-N两种做法结合使用效果更稳。动手前先做两件事一是把库里配体原子数明显偏大的化合物先剔除——亲和力模块的可靠范围是 ≤56 个原子按 RDKit RemoveHs 后的计数128 个是硬性上限详见下文边界条件二是这一步不要拿affinity_pred_value排序它区分不了活性与惰性分子。 先导优化怎么迭代用数值给分子改造指方向拿到先导化合物后问题从它活不活性变成能不能结合得更紧两个字段各自的角色也随之切换基于先导结构做一轮衍生物设计官能团替换、桥环延伸等用 Boltz 批量预测每个衍生物同时记下概率和数值两个字段按双重标准挑候选概率保持在 0.8 以上确认仍是可靠活性分子在幸存者里再按affinity_pred_value升序排取最低的若干个送湿实验验证。数值字段此时充当方向盘这一轮改造如果数值下降且概率没掉方向对了如果概率跌破 0.8说明这次改造丢掉了活性要回退重做而不是继续往这个方向推。两个实用参数--affinity_mw_correction给数值预测头加入分子量校正当衍生物越改越大时建议开启能改善大配体的数值估计对最后几个候选把--diffusion_samples_affinity和--sampling_steps_affinity一起调高比如 10 个样本 × 400 步用更长的运行时间换取更稳的统计小批量精算比全库都开大参数划算。⚠️ 什么情况别用适用边界与结果可信度跑之前对照三条边界检查输入配体大小建议 ≤56 个原子RDKit RemoveHs 后计数128 个以内可以运行但不推荐再大就别用亲和力功能了靶点类型针对蛋白质靶点优化配 RNA/DNA 靶点跑不会报错但输出不可信硬件完整预测依赖 GPU高采样、高步数的精算配置对显存和时间要求更高库级筛选建议先用默认参数跑一遍再精算。可信度方面项目在独立测试集含 FEP benchmark、CASP16、MF-PCBA上报告了两个预测头对实验值的 Pearson 相关和 RMSE与其他模型的对比见下图评估脚本在 scripts/eval/run_evals.py、aggregate_evals.py数据集构建方式写在 docs/evaluation.md。往后看随着训练数据和评测集的持续扩充亲和力模块能覆盖的靶点与分子范围还会继续扩大但概率筛苗、数值精修这套两个数字的工作流现在就可以直接上手用。【免费下载链接】boltzOfficial repository for the Boltz biomolecular interaction models项目地址: https://gitcode.com/GitHub_Trending/bo/boltz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表