蛋白质组规模对接谱的GO术语富集:用于蛋白质靶标发现的生物学搜索空间缩减层

root 提交于 周三, 09/23/2026 - 10:47
从表型优先或作用机制不确定的化合物中识别蛋白质靶标仍然十分困难,这是因为蛋白质组尺度的对接可为每种化合物生成数千个结构上合理的相互作用。我们开发了一套工作流程,将按排名排列的蛋白质组尺度对接谱转换为稳定的基因本体(Gene Ontology,GO)生物过程富集特征,并评估这些特征能否在优先保留已知药物–靶标关系的同时缩小候选靶标空间。对接靶标在PDB链水平上保留,随后映射至唯一的人类基因标识,并以经筛选的结构基因全集为背景,使用PANTHER进行过度表示分析。GO富集分析覆盖排名前25至前505位的蛋白质,步长为10;并依据连续三次转换中Jaccard稳定性阈值达到0.80的标准,选取稳定的化合物级GO特征。基准评估采用Yamanishi药物–靶标相互作用数据集,其中682种完成映射的化合物被分配至预先设定的开发集/留出集(552/130),并在经典、机制性和精细机制性生物学分辨率下进行评估。在完整校正后的基准分析中,642种具有可用经典GO特征的化合物表现出高于类间相似性的类内相似性(0.1019对0.0931;差值 = 0.0088;100,000次置换检验,p = 0.00222),且根据PERMANOVA,经典类别可解释多变量GO特征变异的1.34%(p

从表型优先或作用机制尚不明确的化合物中鉴定蛋白质靶标仍然十分困难,因为蛋白质组尺度的对接可为每个化合物生成数千个结构上合理的相互作用。我们开发了一套工作流程,将按排名排列的蛋白质组尺度对接谱转换为稳定的基因本体(Gene Ontology,GO)生物过程富集特征,并评估这些特征能否在优先保留已知药物–靶标关系的同时缩小候选靶标空间。对接靶标在PDB链水平上予以保留,映射至唯一的人类基因标识,并以经筛选的结构基因全集为背景,使用PANTHER进行过度表示分析。GO富集分析覆盖排名前25至505位的蛋白质,步长为10;并依据连续三次转换中Jaccard稳定性阈值达到0.80的标准,选定稳定的化合物层面GO特征。基准测试采用Yamanishi药物–靶标相互作用数据集,将682个完成映射的化合物按照预先规定的开发集/留出集划分为552/130,并在经典、机制性和精细机制性生物学分辨率下进行评估。在完整的校正后基准测试中,642个具有可用经典GO特征的化合物显示出高于类间相似性的类内相似性(0.1019 对 0.0931;差值 = 0.0088;100,000次置换检验,p = 0.00222);根据PERMANOVA分析,经典类别可解释多变量GO特征变异的1.34%(p

关键词:蛋白质组尺度对接;基因本体;靶标发现;靶标组;PANTHER;靶标捕获;生物学筛选;搜索空间缩减;Yamanishi基准测试


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.15.751870v1?rss=1

🏷️ 蛋白质组学 蛋白质组规模对接 基因本体富集分析 药物靶标发现 搜索空间缩减