- 5 次围观
由于标注数据有限,尤其是经过验证的负样本十分稀缺,加之氨基酸序列与生物学功能之间存在复杂关系,肽分类在生物信息学领域仍面临挑战。本研究提出了 Pep-PU-GAN,一种融合正例-未标注学习(positive-unlabeled,PU)、生成对抗网络(generative adversarial networks,GANs)和图神经网络(graph neural networks,GNNs)的肽分类深度学习框架。该方法将肽表示为由序列衍生的残基图,其中氨基酸作为节点,相邻残基之间通过边连接,从而能够基于注意力机制在局部邻域内进行消息传递。该架构包括一个在编码器空间中生成合成肽嵌入的生成器,以及一个具有双重功能的判别器,用于区分真实嵌入与合成嵌入,同时执行 PU 分类。训练过程采用一种定制损失函数,将非负 PU(non-negative PU,nnPU)风险估计与对抗性目标相结合。此外,自训练机制进一步将高置信度的合成阳性嵌入纳入训练集,以扩充训练数据并提升模型性能。在神经肽分类任务上的评估中,研究使用了 4,049 条阳性神经肽和 8,558 条未标注肽。结果表明,Pep-PU-GAN 优于基线模型,在独立留出基准数据集上取得了 0.93 的 F1 分数和 0.98 的 AUROC。Pep-PU-GAN 为标注数据稀缺而未标注数据丰富条件下的肽分类任务提供了一种具有潜力的方法,并有望应用于计算生物学和药物发现领域。
肽分类由于标注数据有限,尤其是经验证的负样本匮乏,以及氨基酸序列与生物学功能之间关系复杂,在生物信息学领域仍面临挑战。本研究提出了 Pep-PU-GAN,一种结合正例-未标记学习(positive-unlabeled,PU)、生成对抗网络(generative adversarial networks,GANs)和图神经网络(graph neural networks,GNNs)的肽分类深度学习框架。该方法将肽表示为由序列衍生的残基图,其中氨基酸作为节点,相邻残基之间以边相连,从而能够在局部邻域上进行基于注意力机制的消息传递。该架构包括一个在编码器空间中生成合成肽嵌入的生成器,以及一个具有双重功能的判别器,用于区分真实嵌入与合成嵌入,同时执行 PU 分类。训练过程中采用一种定制损失函数,将非负 PU(non-negative PU,nnPU)风险估计与对抗目标相结合。该方法进一步引入自训练机制,将高置信度的合成阳性嵌入纳入训练集,以扩充训练数据并提升模型性能。在神经肽分类任务上的评估中,使用了 4,049 条阳性神经肽和 8,558 条未标记肽;Pep-PU-GAN 超越了基线模型,在独立留出基准数据集上取得了 0.93 的 F1 分数和 0.98 的 AUROC。Pep-PU-GAN 为标注数据稀缺而未标记数据丰富的肽分类任务提供了一种具有前景的方法,并有望应用于计算生物学和药物发现领域。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.13.751209v1?rss=1
🏷️ 肽功能预测 正例-未标记学习 生成对抗网络 图神经网络 深度学习 神经肽分类
来源出处
Pep-PU-GAN:用于肽功能预测的正例-未标记对抗学习
https://www.biorxiv.org/content/10.64898/2026.09.13.751209v1?rss=1