- 4 次围观
背景:亲和力成熟噬菌体展示下一代测序(NGS)产生的成对单链可变片段克隆数量,超过了实验可表征的范围,从而形成了一个固定预算下的优先级排序问题。读数计数提供的是经验性支持,而非直接的亲和力标签。我们开发了 AbPACER(Antibody Parent-Aware Contextual Evidence Ranker,抗体亲本感知上下文证据排序器),这是一种对亲和力标签盲的神经排序模型,结合了相对于亲本的突变描述符、冻结的抗体语言模型上下文,以及来自相关克隆的 NGS 证据。AbPACER 是一种适应具体筛选项目(campaign)的方法,而非零样本方法:对于每个项目,它在返回 384 个候选实验检测名单之前,都会基于成对序列和按轮次解析的 R1-R3 计数进行拟合。我们在两个回顾性噬菌体展示项目中对其进行了评估,并单独评估了其在 AlphaSeq 上的监督均方误差适配版本,记作 AbPACER-MSE。 结果:在冻结的前 5% 候选集合中,包含 16,323 个 Fas 相关因子 1(FAF1)克隆和 7,487 个血管内皮生长因子受体(VEGFR)克隆,各方法对完整的目标特异性集合进行了排序,并选择了 384 个候选。在 FAF1 中,AbPACER 从 7 个回顾性 panel 克隆中恢复了 2.00 +/- 0.00 个,即在每个随机种子下均恢复 2 个;相比之下,总计数方法恢复 1/7,Ens-Grad CNN 恢复 1.00 +/- 0.00 个,A2Binder-HL 恢复 1.67 +/- 1.15 个,AbAffinity 恢复 1.33 +/- 0.58 个。在 VEGFR 中,AbPACER 从 3 个 panel 克隆中恢复了 2.33 +/- 0.58 个,为所观察到的学习方法中最高的平均值,而总计数方法恢复了 3/3。在更广泛的假设预算下,没有任何学习方法始终最优。在公开的 AlphaSeq common split(包含 11,670 个固定测试变体)上,AbPACER-MSE 恢复了真实前 384 名中的 187.0 +/- 2.6 个,与 AbAffinity(188.0 +/- 2.6)非常接近,并优于 A2Binder(175.7 +/- 6.4)和 Ens-Grad CNN(154.0 +/- 6.1)。AbPACER-MSE 更新了 137.8 万个任务特异参数,而 AbAffinity 为 6.5104 亿个,并实现了 Pearson 相关系数 0.687 +/- 0.003 和 Spearman 相关系数 0.652 +/- 0.002。 结论:AbPACER 提供了一个针对具体筛选项目、具备亲本感知能力的框架,用于基于亲和力标签盲的噬菌体展示 NGS 数据进行固定预算优先级排序。在 384 个候选的终点上,它在两个回顾性项目中均表现出学习方法里最高的平均恢复率。AbPACER-MSE 在真实前 384 名恢复率方面与 AbAffinity 非常接近,同时更新的任务特异参数显著更少。这些结果推动了对基于序列条件重排序作为计数优先级排序补充手段的前瞻性评估。
背景:亲和力成熟噬菌体展示的下一代测序(NGS)会产生比实验表征所能覆盖更多的配对单链可变片段(single-chain variable fragment, scFv)克隆,从而形成一个固定预算下的优先级排序问题。读数计数提供的是经验性支持,而非直接的亲和力标签。我们开发了 AbPACER(Antibody Parent-Aware Contextual Evidence Ranker),这是一种对亲和力标签盲的神经排序器,结合了相对于亲本的突变描述符、冻结的抗体语言模型上下文,以及来自相关克隆的 NGS 证据。AbPACER 采用的是适应具体筛选项目(campaign)的方法,而非零样本方法:对于每个 campaign,在返回一个包含 384 个候选的检测列表之前,模型都会基于配对序列以及按轮次解析的 R1-R3 计数进行拟合。我们在两个回顾性噬菌体展示 campaign 中对其进行了评估,并另外在 AlphaSeq 上评估了其采用均方误差监督适配的版本,记为 AbPACER-MSE。
结果:在冻结的前 5% 候选集合中,包含 16,323 个 Fas-associated factor 1(FAF1)克隆和 7,487 个 vascular endothelial growth factor receptor(VEGFR)克隆;每种方法都对完整的目标特异性集合进行排序,并从中选择 384 个候选。在 FAF1 中,AbPACER 在 7 个回顾性 panel 克隆中恢复了 2.00 +/- 0.00 个,即在每个随机种子下均恢复 2 个;相比之下,总计数法恢复 1/7,Ens-Grad CNN 恢复 1.00 +/- 0.00 个,A2Binder-HL 恢复 1.67 +/- 1.15 个,AbAffinity 恢复 1.33 +/- 0.58 个。在 VEGFR 中,AbPACER 在 3 个 panel 克隆中恢复了 2.33 +/- 0.58 个,是所观察到的学习方法中平均值最高的,而总计数法恢复了 3/3。在更广泛的假设预算范围内,没有任何一种学习方法始终最优。在公开的 AlphaSeq common split 上,共有 11,670 个固定测试变体,AbPACER-MSE 恢复了真实前 384 名中的 187.0 +/- 2.6 个,与 AbAffinity(188.0 +/- 2.6)非常接近,并优于 A2Binder(175.7 +/- 6.4)和 Ens-Grad CNN(154.0 +/- 6.1)。AbPACER-MSE 更新了 137.8 万个任务特异性参数,而 AbAffinity 为 6.5104 亿个;其 Pearson 相关系数达到 0.687 +/- 0.003,Spearman 相关系数达到 0.652 +/- 0.002。
结论:AbPACER 提供了一个面向具体 campaign、具备亲本感知能力的框架,可用于基于对亲和力标签盲的噬菌体展示 NGS 数据进行固定预算优先级排序。在 384 候选这一终点上,它在两个回顾性 campaign 中均表现出学习方法中最高的平均恢复率。AbPACER-MSE 在真实前 384 名恢复率方面与 AbAffinity 非常接近,同时更新的任务特异性参数显著更少。这些结果支持对基于序列条件重排序作为计数优先级排序补充手段开展前瞻性评估。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.05.742956v1?rss=1
🏷️ 抗体工程 噬菌体展示 下一代测序 亲和力成熟 神经排序模型 候选克隆优先级排序