ALPACA中一种新的参考不变共识模板生成方法

root 提交于 周日, 05/31/2026 - 20:47
1. 自动化标志点定位将解剖学标志点从参考标本转移到大量目标标本上,从而显著提高分析通量。然而,该过程需要借助一个初始样本进行引导。若初始选择具有任意性或不具代表性,则会留下来源于参考标本的偏倚,并沿着伪标志点、所得形态空间以及后续模板选择不断传播;对于那些其变异范围尚未明晰的大型数据集而言,这种风险尤难避免。 2. 我们以迭代式共识图谱取代固定参考,并通过少数几轮迭代,将其向所有经相似变换对齐标本的 Procrustes 平均形状逐步形变。我们在一个包含 62 个品系的小家鼠(Mus musculus)头骨面板上对该方法进行了评估,分别运行原始固定参考流程和新的共识流程各 62 次,每次依次将每个标本作为初始引导样本。我们比较了图谱收敛性、图谱间相似性、形态空间可重复性、两两 Procrustes 距离中由参考选择引起的方差、下游 k-means 选择稳定性,以及留一法的样本外拟合表现,并在采样平衡程度不同的类人猿数据集上检验了其泛化能力。 3. 共识图谱在少数几轮迭代内即可收敛,且相比固定参考,对初始标本的敏感性显著更低。它产生了更具可重复性的形态空间(平均 RV 值为 0.960,而固定参考为 0.944),将两两距离中来源于参考标本的方差中位数降低了约 60%,使下游模板选择来自更小且更一致的标本池,并且在全部 62 个品系中,对留出标本的拟合都更为紧密。在类人猿数据中,各图谱在表面几何形态上高度一致;但当样本在分类学上存在不平衡时,下游形态空间会表现出对参考的依赖性,而较小但平衡的子集反而优于较大但不平衡的数据集。 4. 迭代式共识图谱构建消除了自动化标志点定位中的一种持续性偏倚,并产生了与参考无关且可重复的结果,其中采样平衡比绝对样本量更为重要。由于该图谱能够迅速稳定,因此可以仅用一个较小且平衡的子集来构建图谱,而其余标本只需相对于该图谱进行标志点定位;这为扩展与参考无关的标志点定位提供了一条切实可行的路径。该方法已在 SlicerMorph 的 ALPACA 中实现,并配有一个支持在高性能计算环境中无头运行的模拟库。

1. 自动化标志点定位将解剖学标志点从参考标本转移到大量目标标本上,从而大幅提高分析通量。然而,这一过程需要通过一个初始样本进行引导。若初始选择具有任意性或不具代表性,则会引入来源于参考标本的偏倚,并使其在伪标志点、所得形态空间以及后续模板选择中持续传播;对于尚未充分了解其变异情况的大型数据集而言,这种风险尤难避免。

2. 我们以迭代共识图谱取代固定参考,并在少数几次迭代中,将其逐步形变至所有经过相似性配准标本的普氏分析平均形状。我们在一个包含62个品系的小家鼠(Mus musculus)头骨面板上对该方法进行了评估:分别运行原始固定参考流程和新的共识流程各62次,每次依次将每个标本用作初始样本。我们比较了图谱收敛性、图谱间相似性、形态空间可重复性、两两普氏距离中由参考选择导致的方差、后续k均值选择的稳定性,以及留一法的样本外拟合效果,并在采样平衡程度不同的大型类人猿数据集上检验了其泛化能力。

3. 共识图谱在少数几次迭代内即可收敛,并且对初始标本的敏感性远低于固定参考方法。它产生了更具可重复性的形态空间(平均RV系数为0.960,而固定参考为0.944),将两两距离中来源于参考标本的方差中位数降低了约60%,使后续模板选择集中于一个更小且更稳定一致的标本集合,并且在全部62个品系中对留出标本均表现出更紧密的拟合。在大型类人猿数据中,各图谱在表面几何上高度一致,但当样本在分类学上不平衡时,后续形态空间会变得依赖于参考标本;同时,一个较小但平衡的子集优于较大但不平衡的样本集。

4. 迭代共识图谱构建消除了自动化标志点定位中的一种持续性偏倚,并产生了与参考标本无关且可重复的结果,其中采样平衡的重要性高于样本绝对规模。由于图谱能够快速稳定下来,因此可以仅基于一个较小且平衡的子集构建图谱,而将其余标本直接相对于该图谱进行标志点定位,这为扩展与参考无关的标志点定位提供了一条切实可行的路径。该方法已在SlicerMorph中的ALPACA模块中实现,并配有一个支持在高性能计算环境中无界面运行的模拟库。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.05.29.728799v1?rss=1

🏷️ 几何形态测量 自动标志点定位 共识模板 Procrustes分析 参考偏倚 小鼠头骨