- 2 次围观
蛋白质-配体亲和力(PLA)预测是人工智能驱动药物发现的核心任务,但基于精确相互作用的方法需要代价高昂的构象准备和数据编码,从而限制了其吞吐量。为协调准确性与效率,我们首先考察了预训练分子表征模型能否替代复杂编码器。对基于序列、图和图像的表征进行统一且多样化的评估,揭示了其整体上的强劲性能以及在家族层面的差异性,并为PLA任务中的编码器选择提供了首个实用性指导。 随后,为在不牺牲表达能力的前提下实现高计算效率,我们借鉴了大型语言模型中的专家混合(MoE)策略。系统性的消融研究揭示了在分子预测中部署MoE的关键设计原则。由此得到的模型HydrAffinity是一种无相互作用、动态稀疏的模型,结合预训练编码器与MoE实现参数高效学习。该模型优于所有无相互作用方法,并在CASF-2016上达到了最先进的基于相互作用方法的水平。路由分析证实,MoE形成了不同的、家族特异性的激活模式,为跨蛋白质类别的动态参数化提供了可解释性证据。DUDE-Z和LIT-PCBA上的零样本测试进一步表明其具有较强的EF5%性能,使HydrAffinity成为一种实用且可扩展的解决方案,可作为有效的早期阶段预筛选工具。
蛋白质-配体亲和力(protein-ligand affinity, PLA)预测是人工智能驱动药物发现的核心任务,但基于精确相互作用的方法需要高成本的构象准备与数据编码,从而限制了其处理通量。为了兼顾准确性与效率,我们首先考察了预训练分子表征模型是否能够替代复杂编码器。对基于序列、图和图像的表征进行统一且多样化的评估,揭示了其整体上的强劲性能以及在不同家族层面的差异性表现,并为PLA任务中的编码器选择提供了首个实用指导。
随后,为了在不牺牲表达能力的前提下实现高计算效率,我们引入了源自大语言模型的专家混合(mixture-of-experts, MoE)策略。系统性的消融研究揭示了在分子预测中部署MoE的关键设计原则。由此得到的模型HydrAffinity是一种无需显式相互作用建模的动态稀疏模型,结合预训练编码器与MoE实现参数高效学习。该模型优于所有无需相互作用建模的方法,并在CASF-2016数据集上达到了最先进的基于相互作用方法的水平。
路由分析证实,MoE形成了明显不同的、家族特异性的激活模式,为蛋白质类别间动态参数化提供了可解释性证据。在DUDE-Z和LIT-PCBA上的零样本测试进一步表明其具有较强的EF5%表现,使HydrAffinity成为一种实用、可扩展的解决方案,可作为有效的早期阶段预筛选工具。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.07.24.740495v1?rss=1
🏷️ 蛋白质-配体亲和力预测 药物发现 预训练分子表征 混合专家模型 零样本筛选
来源出处
一种无需预处理的用于蛋白质-配体亲和力预测的混合专家框架
https://www.biorxiv.org/content/10.64898/2026.07.24.740495v1?rss=1