- 3 次围观
荧光蛋白是细胞成像的基础工具。常规使用的大多数荧光蛋白(包括 GFP)均来源于维多利亚多管发光水母(Aequorea victoria),发射蓝绿色光;这种光会被组织强烈吸收和散射,从而限制成像深度。由细菌光敏色素工程化获得的远红光和近红外荧光蛋白能够解决这一局限,因为远红光在组织中的穿透距离显著更远。然而,这些蛋白通常比其来源于 A. victoria 的对应蛋白暗得多。通过传统定向进化提高亮度需要筛选大规模随机突变文库,这一过程缓慢、劳动密集,且在专门实验室之外往往难以实施。 我们采用了一种主动学习引导的定向进化流程,该流程利用远少于传统筛选所需的数据识别出改良变体。每一轮均将自动化、微型化的无细胞蛋白表达与机器学习模型相结合:前者可直接基于 DNA 模板进行,无需克隆或细胞培养;后者则基于累积的序列—功能数据重新训练,用以提名下一轮信息量最大的变体。将该流程应用于 miRFP670nano3 时,在连续多轮中共筛选了 120 个变体,并鉴定出 12 个亮度提高的变体,其中最佳变体在细菌系统中的亮度提高了 4 倍。然而,当这些变体在哺乳动物细胞中进行评估时,这些增益并未得到体现,表明蛋白性能可能强烈依赖于细胞环境。 基于 ProteinGym 基准数据集的回顾性模拟显示,在每批次样本数更少的情况下进行更多实验批次,能够持续加快向高适应度序列收敛的速度。引入源自蛋白质语言模型的零样本适应度先验同样能够加快收敛,但其效果仅与各先验评分和真实适应度景观之间的相关程度成正比。综上,这些发现确立了可推广的设计原则,即在最少实验数据条件下进行蛋白质工程时,应优先采用更小的采集批次和按置信度加权的先验。
荧光蛋白是细胞成像的基础工具。常规使用的大多数荧光蛋白(包括 GFP)均来源于维多利亚多管水母(Aequorea victoria),并发射蓝绿色光;这种光会被组织强烈吸收和散射,从而限制了成像深度。源自细菌光敏色素并经工程化改造的远红和近红外荧光蛋白能够克服这一限制,因为远红光在组织中的穿透距离显著更远。然而,这些蛋白通常比来源于 A. victoria 的对应蛋白暗得多。通过传统定向进化提高亮度需要筛选大型随机突变文库,这一过程缓慢、劳动密集,且在专业实验室之外往往难以实施。
我们采用了一种由主动学习引导的定向进化流程,与传统筛选相比,该流程能够基于显著更少的数据识别出性能改良的变体。每一轮实验均将自动化、微型化的无细胞蛋白表达与机器学习模型相结合:无需克隆或细胞培养,即可直接从 DNA 模板进行蛋白表达;同时,基于累积的序列—功能数据对机器学习模型进行重新训练,以提名下一轮中信息量最大的变体。将该流程应用于 miRFP670nano3 时,我们在连续多轮实验中筛选了 120 个变体,并鉴定出 12 个亮度提高的变体,其中最佳者在细菌系统中的亮度提高了四倍。然而,当在哺乳动物细胞中评估这些变体时,这些增益并未得以体现,这表明蛋白性能可能强烈依赖于细胞环境。
基于 ProteinGym 基准数据集的回顾性模拟表明,在每批样本数更少的情况下进行更多实验批次,能够稳定地加速向高适应度序列的收敛。引入由蛋白质语言模型导出的零样本适应度先验同样能够加速收敛,但这种加速效果仅与各先验评分和真实适应度景观之间的相关程度成正比。综合来看,这些发现确立了可推广的设计原则:在利用最少实验数据进行蛋白工程改造时,应优先采用更小的采集批次以及按置信度加权的先验信息。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.12.744534v1?rss=1
🏷️ 主动学习 定向进化 远红荧光蛋白 蛋白质工程 机器学习 无细胞表达