- 6 次围观
单细胞领域的文献通常将细胞状态编目为经验证的标志基因程序——这是一种稀疏的、组合式的先验。传统嵌入方法并未利用这种先验,而是从表达矩阵中从头学习细胞状态结构,因而产生需要事后解释和批次校正的稠密维度。在此,我们展示了编码智能体能够直接依据文献构建单细胞嵌入模型。给定一个将这一文献视角聚焦于特定生物学子领域的场景,智能体会编辑一个结构化的 Python 模板,整理带有名称和文献引证的基因程序,并将其组合为坐标轴,全程无需基因集数据库、无需训练,也无需查看数据。在小鼠和人类组织中,这些零样本嵌入在生物学质量上可与传统基线、基础模型基线以及程序信息引导的基线相媲美;它们在构造上即具有批次稳健性,并且在不同运行之间具有可重复性,可作为数据驱动嵌入的补充。由于每个维度都是一个具名且有文献引证的基因程序,因此该嵌入具有可解释性和可审计性,而且其可组合的坐标轴还可以被引导组织为发育树。
单细胞研究文献通常将细胞状态编目为经验证的标记基因程序——一种稀疏的、组合式的先验。传统嵌入方法并不利用这一先验,而是直接从表达矩阵中从头学习细胞状态结构,生成需要事后解释和批次校正的稠密维度。本文表明,编码智能体可以直接基于文献构建单细胞嵌入模型。给定一个将这一文献视角聚焦于所选生物学子领域的场景,智能体会编辑一个结构化的 Python 模板,整理具名且有文献引证的基因程序,并将其组合为多个轴,而无需基因集数据库、训练过程或查看数据。在小鼠和人类组织中,这些零样本嵌入在生物学质量方面与传统基线、基础模型基线以及程序知情基线相比具有竞争力;其在构造上具有批次稳健性,并且在不同运行之间可复现,从而对数据驱动的嵌入形成补充。由于每个维度都是一个具名且有引文支持的基因程序,因此该嵌入具有可解释性和可审计性,并且其可组合的各个轴可以被引导构建为一棵发育树。
感谢您有兴趣帮助传播 bioRxiv 的信息。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.07.07.737048v1?rss=1
🏷️ 单细胞嵌入 可解释模型 基因程序 零样本学习 文献驱动建模 批次稳健性
来源出处
编码智能体根据文献构建可解释的单细胞嵌入模型
https://www.biorxiv.org/content/10.64898/2026.07.07.737048v1?rss=1