- 2 次围观
脱靶切割是 CRISPR-Cas9 基因组编辑中的一个核心安全问题,尤其是在治疗应用中,因非预期双链断裂会带来临床风险。我们对五种机器学习分类器进行了基准评估:基于错配计数汇总特征的逻辑回归;基于独热编码 sgRNA/候选位点序列对的随机森林和梯度提升模型;基于位置错配图的一维卷积神经网络(CNN);以及梯度提升/CNN 集成模型:所用数据为一个真实的、已发表的 GUIDE-seq 脱靶数据集(Kleinstiver 等,2016,Nature),其中包含针对 5 条 sgRNA 的 95,829 个候选脱靶位点,而其中仅有 54 个(0.06%)经实验证实为真实切割位点。在保留的分层测试集上(n = 19,166;11 个真实阳性),基于组合错配与序列特征的梯度提升模型表现最佳(ROC-AUC = 0.997,PR-AUC = 0.355,最佳 F1 = 0.50),优于仅基于原始序列编码的随机森林(PR-AUC = 0.083)和序列 CNN(PR-AUC = 0.129)。由于正类极其稀少,我们将精确率-召回率曲线下面积(PR-AUC)而非 ROC-AUC 作为主要评价指标,因为 ROC-AUC 会因负类数量庞大而被高估。 位置错配分析表明,经实验证实的脱靶位点总体上携带的错配显著少于未被切割的候选位点(在 23 核苷酸靶序列范围内,平均分别为 3.6 个和 5.9 个错配),并且在 10 核苷酸的 PAM 近端种子区以及 PAM 本身表现出明显更低的错配耐受性(种子区逐位点错配率分别为 11.3% 和 27.4%,PAM 处分别为 6.8% 和 16.0%),这与 Cas9 靶标识别中已确立的种子区和 PAM 敏感性模型一致。我们报告这些发现,包括在这种严重类别不平衡且正类样本极少的情境下所能达到的较低绝对精确率,以此真实反映仅依赖序列信息的脱靶分类器目前能够做到和仍无法做到的程度。
脱靶切割是 CRISPR-Cas9 基因组编辑中的核心安全问题,尤其是在治疗性应用中,非预期双链断裂会带来临床风险。我们对五种机器学习分类器进行了基准比较:基于错配计数汇总特征的逻辑回归、基于独热编码 sgRNA/候选位点序列对的随机森林和梯度提升模型、基于位置错配图的一维卷积神经网络(CNN),以及梯度提升/CNN 集成模型;所用数据为真实且已发表的 GUIDE-seq 脱靶数据集(Kleinstiver 等,2016,Nature),其中包含 5 条 sgRNA 对应的 95,829 个候选脱靶位点,而其中仅有 54 个(0.06%)经实验验证为真实切割位点。
在保留的分层测试集上(n = 19,166;11 个真阳性),基于组合错配与序列特征的梯度提升模型表现最佳(ROC-AUC = 0.997,PR-AUC = 0.355,最佳 F1 = 0.50),优于仅基于原始序列编码的随机森林(PR-AUC = 0.083)和序列 CNN(PR-AUC = 0.129)。由于正类极其罕见,我们将精确率-召回率曲线下面积(precision-recall AUC, PR-AUC)而非 ROC-AUC 作为主要评价指标,因为 ROC-AUC 会因负类数量庞大而被抬高。
位置错配分析表明,经实验验证的脱靶位点在整体上所含错配显著少于未发生切割的候选位点(在 23 核苷酸靶序列范围内,平均错配数分别为 3.6 和 5.9),并且在 10 核苷酸的 PAM 近端种子区表现出明显更低的错配耐受性(逐位点错配率分别为 11.3% 和 27.4%),在 PAM 位点本身亦是如此(6.8% 对 16.0%);这一结果与 Cas9 靶标识别中已确立的种子区和 PAM 敏感性模型一致。我们报告这些发现,包括在这种类别极度不平衡且正类样本极少的设定下所能达到的较低绝对精确率,以此真实呈现仅依赖序列信息的脱靶分类器目前能够做到什么、以及尚不能做到什么。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.19.745843v1?rss=1
🏷️ CRISPR-Cas9 脱靶效应 GUIDE-seq 类别不平衡 机器学习 基因组编辑