- 5 次围观
T细胞受体(TCR)特异性预测对于理解适应性免疫以及推动治疗性干预措施的开发至关重要。尽管众多研究团队已投入大量精力,且蛋白质语言模型也取得了进展,但当前用于预测TCR-肽-MHC相互作用的机器学习模型表现仍然不佳。本研究识别并解决了可能阻碍该领域发展的根本性问题,重点考察当前构建训练集和验证集的方法,尤其是常用方法所采用的策略。这些方法通常通过在不同表位之间打乱TCR,或将表位与来自健康供者背景数据集的TCR进行配对,来生成阴性数据。在本研究中,我们利用一系列序列嵌入方法,对通过上述两种策略生成的阳性TCR集合与阴性TCR集合之间的重叠进行可视化和定量分析。这些嵌入方法包括简单编码方式(独热编码和BLOSUM62)、通用蛋白质语言模型(ESM-2和ProtGPT2),以及TCR特异性嵌入模型(TCR-BERT)。我们使用来自VDJdb、针对两个研究较为充分的表位(GILGFVFTL和KLGGALQAK)的配对βTCR数据,在每种嵌入表示上训练随机森林分类器,并评估其区分阳性与阴性数据样本的能力。我们发现,通用序列嵌入方法难以区分阳性TCR与阴性TCR。进一步研究表明,阴性数据生成方法的选择会显著影响分类器性能。我们的研究结果揭示了当前TCR特异性训练数据和通用蛋白质语言模型存在的根本性局限,并强调了开发TCR特异性嵌入、构建经实验验证的阴性数据集、透明报告阴性数据构建方法,以及采用表位特异性建模策略的必要性。
通用蛋白质语言模型和公共TCRpMHC数据在训练特异性预测模型中的局限性 | bioRxiv
跳转至主要内容 首页 关于 投稿 提醒 / RSS 搜索该关键词 高级搜索 最新结果
通用蛋白质语言模型和公共TCRpMHC数据在训练特异性预测模型中的局限性
Brajesh Rai , Sarah Hall-Swan
doi: https://doi.org/10.64898/2026.09.21.753204
Brajesh Rai 辉瑞(Pfizer)
在Google Scholar中查找该作者 在PubMed中查找该作者 在本网站搜索该作者
通讯作者: brajesh.rai{at}pfizer.com
Sarah Hall-Swan 辉瑞(Pfizer)
在Google Scholar中查找该作者 在PubMed中查找该作者 在本网站搜索该作者
摘要
信息/历史 指标 补充材料 预览PDF
摘要
T细胞受体(TCR)特异性预测对于理解适应性免疫以及推动治疗干预措施的开发至关重要。尽管许多研究团队投入了大量工作,且蛋白质语言模型不断取得进展,但当前用于预测TCR-肽-MHC相互作用的机器学习模型表现仍然较差。本研究聚焦于当前训练集和验证集的构建方法,尤其是常用方法所采用的策略,识别并解决可能阻碍该领域进展的根本问题。这些常用方法通常通过在不同表位之间随机置换TCR,或将表位与来自健康供者背景数据集的TCR配对,来生成负样本数据。
在此,我们利用一系列序列嵌入方法,对通过上述两种策略生成的阳性和负性TCR集合之间的重叠进行可视化和定量分析。这些方法包括简单编码方式(一位有效编码和BLOSUM62)、通用蛋白质语言模型(ESM-2和ProtGPT2),以及TCR特异性嵌入模型(TCR-BERT)。我们使用来自VDJdb、针对两个研究较为深入的表位(GILGFVFTL和KLGGALQAK)的配对αβTCR数据,在每种嵌入表示的基础上训练随机森林分类器,并评估其区分阳性数据样本和阴性数据样本的能力。
我们发现,通用序列嵌入方法难以区分阳性TCR和阴性TCR。我们进一步表明,负样本数据的生成方法会显著影响分类器性能。我们的研究结果凸显了当前TCR特异性训练数据和通用蛋白质语言模型所存在的根本局限,并强调了对TCR特异性嵌入、经实验验证的负样本数据集、透明报告负样本构建方法以及表位特异性建模策略的需求。
利益冲突声明
所有作者现在或曾经是辉瑞公司(Pfizer Inc.)的员工,并可能持有该公司的股票或股票期权。
版权
。 保留所有权利。未经许可不得再利用。
返回顶部 上一篇 下一篇
发布于2026年9月25日。
下载PDF 补充材料 电子邮件
感谢您有意传播bioRxiv上的内容。
您的电子邮件 *
您的姓名 *
发送至 *
请输入多个地址,每行一个地址,或使用逗号分隔。
您即将发送的文章如下:
通用蛋白质语言模型和公共TCRpMHC数据在训练特异性预测模型中的局限性
邮件主题
(您的姓名)从bioRxiv网站转发了一个页面给您
邮件正文
(您的姓名)认为您可能会对bioRxiv网站上的该页面感兴趣。
您的个人留言:
验证码
此问题用于测试您是否为真人,并防止自动垃圾邮件。
分享
通用蛋白质语言模型和公共TCRpMHC数据在训练特异性预测模型中的局限性
Brajesh Rai , Sarah Hall-Swan
bioRxiv 2026.09.21.753204; doi: https://doi.org/10.64898/2026.09.21.753204
分享本文:
复制
引用工具
通用蛋白质语言模型和公共TCRpMHC数据在训练特异性预测模型中的局限性
Brajesh Rai , Sarah Hall-Swan
bioRxiv 2026.09.21.753204; doi: https://doi.org/10.64898/2026.09.21.753204
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.21.753204v1?rss=1
🏷️ T细胞受体特异性预测 TCR-pMHC相互作用 蛋白质语言模型 负样本构建 序列嵌入 机器学习分类