- 5 次围观
抗菌肽(AMP)通常可针对多类病原体发挥作用,因此,与二元抗菌分类相比,多标签活性预测更符合实际筛选需求。ESCAPE 基准对这一任务进行了形式化定义,但当前领先方法通常依赖多模态、结构条件化的深度模型,训练与调参成本较高。我们表明,通过将 330 个具有可解释性的序列描述符与 TabPFN 相结合,一种简单的、仅基于序列的流程即可达到并超越这些方法的性能。TabPFN 是一种表格基础模型,能够在单次前向传播中执行上下文内预测,无需基于梯度的训练或超参数搜索。在 ESCAPE 数据集(82,359 条肽序列;五个标签)上,采用标签幂集方法的 TabPFN 模型取得了 77.8% 的 mAP-5,相较此前报告的最佳结果 72.1% 有所提升。一种概率分类器链模型首次在五个标签上同时达到或超过已发表的最佳平均精确率。在此前最先进的单折训练协议下,这些性能增益依然存在,表明其并非训练集规模造成的假象;对于远缘同源序列(序列一致性低于 30%),性能提升尤为显著,达到 11.2 个百分点。消融实验进一步表明,推定结构在推理阶段并非必需,且模型性能并非由某一类描述符单独驱动:仅使用十个全局理化性质标量,即可恢复完整特征性能的 91%。最后,对标签依赖关系进行显式建模能够针对性地提升稀缺活性的预测效果,并支持基于部分阳性证据对下一步优先检测的活性进行排序。
抗菌肽(antimicrobial peptides,AMPs)通常可针对多类病原体发挥作用,因此,与二元抗菌分类相比,多标签活性预测更符合实际筛选需求。ESCAPE 基准对这一任务进行了形式化定义,但现有领先方法通常依赖多模态、结构条件化的深度模型,训练与调优成本较高。我们表明,通过将 330 个具有可解释性的序列描述符与 TabPFN 相结合,一种简单的、仅基于序列的流程即可达到并超越这些方法的性能。TabPFN 是一种表格基础模型,能够通过单次前向传播执行上下文预测,无需基于梯度的训练或超参数搜索。在 ESCAPE 数据集(82,359 条肽序列;五个标签)上,采用标签幂集(label-powerset)的 TabPFN 模型取得了 77.8% 的 mAP-5,相较此前报道的最佳结果 72.1% 有所提升。一种概率分类器链方法首次在五个标签上同时达到或超过已发表的最佳平均精确率。在此前最先进的单折训练方案下,这些性能增益仍然存在,表明其并非训练集规模造成的假象;其中,对于远缘同源序列(序列一致性低于 30%),性能提升最大,达到 11.2 个百分点。消融实验进一步表明,推断阶段并不需要预测结构,且模型性能并非由某一个描述符家族单独驱动:仅使用 10 个全局理化标量特征,即可恢复完整特征性能的 91%。最后,对标签依赖关系进行显式建模,可针对性地提升稀有活性的预测效果,并支持根据部分阳性证据对下一步应检测的活性进行排序。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.27.747591v1?rss=1
🏷️ 抗菌肽活性预测 多标签分类 表格基础模型 序列描述符 上下文学习
来源出处
粗粒度组成足矣:用于多活性抗菌肽谱分析的表格型上下文学习
https://www.biorxiv.org/content/10.64898/2026.08.27.747591v1?rss=1