8月4日,化学领域重要期刊Results in Chemistry在线发表了玩球平台智慧农业学院(人工智能学院)计智伟教授课题组的题为“HMRLBA: A hierarchical multi-scale representation learning model for predicting protein-ligand binding affinity”的研究论文。在这项工作中,研究人员开发了一款蛋白-配体结合亲和力预测的回归模型HMRLBA,可用于蛋白-配体相互作用研究、小分子药物虚拟筛选。

据悉,该团队成功研发了一种层次级联的多尺度特征表示模型HMRLBA,融合了蛋白质的氨基酸序列与三维结构,以及配体的SMILES字符串,实现蛋白-配体结合亲和力预测(图1A)。任一蛋白质的最终特征表示只有结构和表面特征(图1C),序列特征仅作为基础用于初始化结构和表面特征,这有效地控制了特征向量的维度。丰富的序列特征表示,则来源于一个集成了多种预训练语言模型的特征提取模块(图1B)。与此同时,配体被转化为图结构以捕获原子层面的特征(图1D)。该模型将为AI驱动的药物虚拟筛选与分子优化提供高精度的计算工具。

图1. HMRLBA模型框架图
在这项工作中,研究人员用基准数据集对HMRLBA的预测性能进行了深入测试。首先,将HMRLBA应用于PDBbind v2019,CASF2016等基准数据集,结果显示该模型的性能超越了9个SOTA方法,包括著名的Holoprot,MaSIF,HaPPy以及MEGDTA。
随后,在Metz激酶组学基准测试中进一步验证了HMRLBA的泛化能力。该数据集涵盖170种激酶、1423个化合物,共计35259个复合物,经去重处理后保留35251个样本用于测试。所有模型均用PDBbind v2019(30%序列一致性)的数据集进行训练。HMRLBA展现出卓越性能:其均方根误差(RMSE)低至0.916,较次优模型HaPPy(0.929)降低约1.4%;皮尔逊相关系数达0.295,较HaPPy(0.216)提升约36.6%(表1)。这一结果证明了HMRLBA在建模亲和力-结构的线性依赖关系方面具备较高精度,并对未知蛋白-配体结合数据表现出强大的泛化能力。
表1.基于PDBbind v2019(30%序列一致性)训练的模型在MetZ数据集上的预测性能

为了进一步验证其在药物虚拟筛选方面的潜力,在MUV基准集上开展性能测试,并将HMRLBA这个回归模型与基于分子对接的打分函数(例如,Vina, Gnina,RF-Score, OnionNet等)进行比较。结果显示,HMRLBA在各项指标上均展现出强劲竞争力:其AUPR(0.004)、AUROC(0.563)及EF 1%(1.791)三项关键指标均仅次于经典对接软件Vina,位列第二。值得注意的是,尽管Vina综合表现略优,但其AUROC标准差(0.083)显著高于HMRLBA(0.075),这意味着HMRLBA在保持高判别精度的同时,具备更优的鲁棒性与稳定性。此外,在更宽松的EF 5%阈值下,HMRLBA同样以1.478的分值位居第三。这些结果证明,HMRLBA成功平衡了筛选精度与模型鲁棒性,已具备支撑实际药物虚拟筛选任务的潜力。
表2.基于PDBbind v2019(30%序列一致性)训练的模型在MUV数据集上的预测性能

为验证HMRLBA的实战能力,选取多疾病靶点EGFR开展案例研究。在包含2616种FDA批准药物(含13种已知EGFR抑制剂)的化合物库中,HMRLBA凭借在PDBbind数据集上的预训练优势,仅通过SMILES字符串和蛋白结构即完成亲和力预测(图2A)。结果显示,HMRLBA将13种抑制剂中的11种成功排入预测榜单前30%,优于对比模型HaPPy(9/13)和MaSIF(8/13)(图2B)。尤为亮眼的是,HMRLBA是唯一将一线肺癌靶向药莫博赛替尼和奥希替尼同时推进至预测榜单前2%的模型,且对其中6种抑制剂赋予了最高亲和力评级,远超HaPPy(2种)、MaSIF(3种)和Holoprot(2种)(图2C-D)。上述结果有力证实了HMRLBA在真实药物筛选场景中的精准识别能力。

图2.案例研究:EGFR抑制剂的虚拟筛选
与聚焦临床应用的FDA药物库不同,BindingDB涵盖了已上市及在研化合物,为新药发现提供了更广阔的探索空间。为验证HMRLBA的广谱适用性,研究者在BindingDB精选数据集上进行了评估(图3A)。结果显示,在69个全新测试样本中,HMRLBA取得了最低的均方根误差(RMSE)和最高的皮尔逊相关系数,预测精度全面超越所有对比模型(图3B)。然后,以白血病治疗靶点Dot1L开展案例研究,在7种已报道的选择性抑制剂中,HMRLBA对其中3种的亲和力预测值与实验值最为接近,优于MaSIF(2种)、HaPPy(1种)和Holoprot(1种)(图3C)。这一结果暗示了HMRLBA在前瞻性化合物优选方面具备领先优势,有望成为早期药物研发的有效工具之一。

此外,研究人员还将HMRLBA模型部署到了其团队前期开发的药物发现计算平台CAd3,实现了端到端的大规模虚拟筛选与先导化合物精准鉴定。

图4.药物发现平台Cad3中调用HMRLBA的操作界面
本文的第一作者和通讯作者为计智伟教授。人工智能学院博士生徐忠煜、硕士生杨骏驰、礼来公司(美国)陈凯博士、中国科学技术大学李志锦博士、玩球平台黄金虎教授等参与了这项工作。UNC Chapel Hill的Weiling Zhao教授、UTHealth的Jiajia Liu助理教授为论文的撰写提供了宝贵建议。本项工作受到2025年国家外专项目、玩球平台高层次人才科研启动费等经费支持。
原文链接:https://www.sciencedirect.com/science/article/pii/S2211715626006739?via%3Dihub
阅读次数:16
【 转载本网文章请注明出处 】