ABCP_finder:基于Transformer嵌入的抗乳腺癌肽预测

root 提交于 周一, 09/14/2026 - 20:47
乳腺癌仍是全球女性癌症相关死亡的主要原因之一。药物耐药性、毒性以及靶点特异性有限,是开发有效治疗药物所面临的主要挑战。抗乳腺癌肽(anti-breast cancer peptides,ABCPs)因具有低毒性、高选择性以及靶向癌细胞的能力,已成为有效的候选药物。然而,仅通过实验方法鉴定新型ABCPs非常耗时且成本高昂。为应对这一挑战,我们开发了ABCP_finder,这是首个专门用于ABCP预测的计算框架,其采用基于Transformer的蛋白质语言模型嵌入。我们精心构建了阳性和阴性数据集,以确保分类任务具有生物学意义。为避免数据泄漏并实现真实可靠的评估,采用同源性意识的训练集–测试集划分策略,通过CD-HIT将序列一致性设定为30%、覆盖度设定为80%。首先利用预训练的Transformer模型ProtBERT和ESM2生成肽序列表征,随后使用多层感知机(MLP)进行分类。在所测试的模型中,ProtBERT表现出优异性能,准确率达到93.82%,召回率为86.88%,F1分数为90.59%,马修斯相关系数(MCC)为0.8618,曲线下面积(AUC)为96.67%,Brier分数为0.0633,表明其在类别不平衡条件下具有较强的预测能力。校准分析支持选用0.7的概率阈值,以识别高置信度ABCPs。进一步利用xDeep-AcPEP进行外部验证发现,经ABCP_finder预测为ABCPs的未知肽序列表现出良好的IC值,从而支持了这些未知肽的生物学相关性。总体而言,ABCP_finder为大规模筛选ABCPs提供了可靠且实用的平台,有望显著加速用于乳腺癌治疗的新型肽类药物的发现。

乳腺癌仍然是全球女性癌症相关死亡的主要原因之一。耐药性、毒性以及有限的靶点特异性是开发有效治疗药物所面临的主要挑战。抗乳腺癌肽(anti-breast cancer peptides,ABCPs)因其低毒性、高选择性以及靶向癌细胞的能力,已成为有效的候选药物。然而,仅通过实验方法鉴定新的ABCPs耗时长且成本高昂。为应对这一挑战,我们开发了ABCP_finder,这是首个专门设计用于预测ABCPs的计算框架,其采用基于Transformer的蛋白质语言模型嵌入。我们精心构建了正、负数据集,以确保分类任务具有生物学意义。为避免数据泄漏并实现真实可靠的评估,采用同源性感知的训练集—测试集划分策略,利用CD-HIT将序列一致性设定为30%、覆盖度设定为80%。首先使用预训练的Transformer模型ProtBERT和ESM2生成肽的表征,随后采用多层感知机(MLP)进行分类。在所测试的模型中,ProtBERT表现出更优的性能,准确率为93.82%,召回率为86.88%,F1得分为90.59%,马修斯相关系数(MCC)为0.8618,曲线下面积(AUC)为96.67%,Brier得分为0.0633,表明其在类别不平衡条件下具有较强的预测能力。校准分析支持将0.7的概率阈值作为识别高置信度ABCPs的标准。进一步利用xDeep-AcPEP进行外部验证表明,被ABCP_finder预测为ABCPs的未知肽序列具有较为理想的IC值,从而支持了这些未知肽的生物学相关性。总体而言,ABCP_finder为大规模筛选ABCPs提供了可靠且实用的平台,有望显著加速用于乳腺癌治疗的新型肽类药物的发现。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.06.749767v1?rss=1

🏷️ 抗乳腺癌肽 肽序列预测 Transformer嵌入 蛋白质语言模型 机器学习分类 计算药物发现