评估面部至BMI视觉Transformer模型在多样化人群中的性能偏差

root 提交于 周六, 09/05/2026 - 16:47
利用面部特征估算身体质量指数(BMI)的计算机视觉模型,为身体测量提供了一种非侵入性、低成本的替代方案,可应用于远程医疗、缺乏体重秤或测量工具的急救场景、自动化自我监测以及大规模流行病学研究。然而,这些模型大多基于政府记录、社交媒体图像和名人照片进行训练,而这些数据来源会引入数据集偏倚,且无法代表普通人群。本研究检验了一种面部特征至BMI机器学习模型在不同人群中的泛化能力,具体考察形态多样性和特定人群训练数据如何影响跨文化预测准确性。我们基于来自四个原住民群体的配对BMI测量数据与面部照片,训练并评估了视觉Transformer(ViT-H/14)模型:马来西亚的Orang Asli人群、南部非洲的Ju/hoansi人群、居住在菲律宾的Sama人群,以及玻利维亚的Tsimane人群。为评估训练数据构成对预测结果的影响,我们比较了四种训练策略,从单一人群模型(目标人群模型)到基于完整合并全球数据集训练的模型(全球模型)。在分布内训练条件下,模型始终取得最佳性能。无论是目标人群模型还是全球模型,只要训练数据包含目标人群的形态特征,模型就能对该人群的BMI作出最准确的预测。然而,当目标人群与训练样本存在差异时,在训练数据中加入更多跨文化变异能够提升分布外预测的表现。因此,当某一人群拥有自身数据时,使用该人群的数据进行训练效果最佳;而当这类数据不存在时,采用涵盖广泛人类形态变异的数据进行训练则是最有效的替代方案。这些发现表明,尽管使用目标人群的训练数据能够获得最准确的结果,但采用能够体现全球形态变异的数据集,可以显著提升模型在未被代表人群中的表现。训练数据中更广泛的多样性,对于开发能够在人类不同人群之间可靠泛化的机器学习健康工具至关重要。

利用面部特征估算身体质量指数(BMI)的计算机视觉模型,为身体测量提供了一种非侵入性、低成本的替代方案,可应用于远程医疗、无法获得体重秤或测量工具的急救护理、自动化自我监测以及大规模流行病学研究。然而,这些模型大多基于政府记录、社交媒体图像和名人照片进行训练,而这些数据来源会引入数据集偏差,且无法代表普通人群。本研究检验了一种面部特征至BMI机器学习模型在不同人群中的泛化能力,具体考察形态多样性和特定人群训练数据如何影响跨文化预测准确性。我们利用来自四个原住民群体的BMI测量值与面部照片配对数据,训练并评估了视觉变换器(Vision Transformer,ViT-H/14)模型,这四个群体分别为马来西亚的奥朗阿斯里人、南部非洲的朱/霍安西人、居住在菲律宾的萨马人,以及玻利维亚的齐马内人。为评估训练数据构成如何影响预测结果,我们比较了四种训练策略,其范围从基于单一人群训练的模型(目标人群模型)到基于完整合并全球数据集训练的模型(全球模型)。在分布内训练条件下,模型始终取得最佳性能。接触过目标人群形态特征的模型,无论是目标人群模型还是全球模型,对该人群的BMI预测准确性始终最高。然而,当目标人群与训练样本存在差异时,在训练数据中加入更多跨文化变异能够改善分布外预测结果。因此,当某一人群拥有自身数据时,使用该人群的数据进行训练效果最佳;而当缺乏此类数据时,使用涵盖广泛人类形态变异的数据进行训练则是最可靠的替代方案。这些发现表明,尽管使用目标人群的训练数据能够获得最准确的结果,但在训练数据集中纳入全球形态变异,能够显著提升模型在未被代表人群中的表现。训练数据更广泛的多样性对于开发能够在人类不同群体之间可靠泛化的机器学习健康工具至关重要。

感谢您有兴趣传播bioRxiv上的研究成果。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.02.748815v1?rss=1

🏷️ 面部图像BMI预测 视觉Transformer 机器学习偏差 跨文化泛化 训练数据多样性