- 3 次围观
网络中心性是基因优先排序的主力工具,然而,排序遗漏了什么却很少被审计。将每次选择与一个注释计数匹配的最大熵参照进行比较——即询问所选基因集是覆盖了基因组的功能空间,还是使其塌缩——结果显示,标准用法中的判据在其本应识别的那一类中恰恰存在一个可测量的盲点。 度数(degree)这一使用最广泛的判据,返回的是同时在局部占据主导地位的跨模块桥接者——连接枢纽(connector hubs)——而遗漏了非枢纽型连接者(non-hub connectors):当基因组中有26%的基因承担这些协调角色时,按度数排序的列表仅包含18%,而按EDVS排序的列表包含55%;并且,在所测试的全部五个网络中,按度数排序的前1%基因在功能覆盖上均低于参照,表现为功能覆盖的塌缩。我们将EDVS(Entropy of Degree-Vector Sums,度向量和熵)重新用作一种无注释、无划分的中心性指标,以恢复这一被遗漏的类别。它所保留的覆盖由跨模块参与度P承载,而P若无社区划分便无法计算;EDVS在五个网络上无需任何社区划分便达到了与P同水平的覆盖,并且在边扰动下保留了其选择结果的0.84,而基于划分的选择仅保留0.21至0.46。 这种缺陷具有普遍性:功能覆盖的塌缩在两个未使用功能注释构建的网络上(0.5–1.1比特;共表达、物理互作)与在三个受其监督构建的网络上(1.6–3.3比特;RiceNet、AraNet、STRING)方向一致,因此监督所起的是放大作用,而非生成作用。补救也是有界的:在稀疏的物理互作网络上,EDVS不再能够保留这种覆盖。而EDVS所分离出的这一类别反映的是组织角色,而非重要性信号:预注册的探针——必需性、转录因子身份、组织特异性、日期/派对枢纽特征、表型共定位——始终给出零结果或反向结果。其中具有决定性的那些结果,与其度数匹配的零模型相比都落在{+/-}5个百分点之内(这是被证明的等价,而不只是未能检测到差异),而“中心性与重要性耦合”这一经典命题本身也仅在依赖具体网络的条件下才成立。
网络中心性是基因优先排序的主力方法,然而,一个排序所遗漏的内容却很少受到审查。将每一次选择与一个在注释计数上匹配的最大熵参考进行比较——即考察所选基因集是覆盖了基因组的功能空间,还是使其坍缩——可以揭示:标准使用的判据在它本应识别的那一类对象上存在一个可测量的盲点。度(degree)作为最广泛使用的判据,返回的是同时具有局部主导性的跨模块桥接者——连接枢纽(connector hubs)——却遗漏了非枢纽连接者(non-hub connectors):当全基因组中有26%的基因处于这些协调性角色时,按度排序的列表仅包含18%,而按EDVS排序的列表包含55%;并且,在所测试的全部五个网络中,按度排序的前1%会使功能覆盖度在参考基线之下发生坍缩。
我们将EDVS(Entropy of Degree-Vector Sums,度向量和熵)重新用作一种无注释、无划分的中心性指标,这是一种信息论意义上的多样性度量,能够恢复这一被遗漏的类别。它所保留的覆盖度由跨模块参与系数P(participation coefficient)所承载,而P若无社区划分则无法计算;EDVS在五个网络上无需任何社区划分便达到了与P同水平的覆盖度,并且在边扰动条件下保留了其选择结果的0.84,而基于划分的选择方法仅保留0.21–0.46。
这种缺陷具有普遍性:在两个未使用功能注释构建的网络中(0.5–1.1比特;共表达网络、物理互作网络),这种坍缩与在三个受功能注释监督构建的网络中(1.6–3.3比特;RiceNet、AraNet、STRING)表现出相同方向,因此,监督并非造成这一问题,而是放大了它。补救措施也有其边界:在稀疏的物理互作网络中,EDVS不再能够保持覆盖度。而EDVS所分离出的这一类别体现的是组织性特征,而非重要性信号:预注册检验——必需性、转录因子身份、组织特异性、date/party-hub特征、表型共定位——始终返回零结果或反向结果。其中,最具决定性的检验在其与度匹配的零模型相比时,差异都落在{+/-}5个百分点以内(这是被证明的,而非仅仅“未能检出”差异),而中心性与重要性的经典耦合关系本身也仅在依赖具体网络的条件下成立。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.10.743862v1?rss=1
🏷️ 基因网络 网络中心性 功能覆盖 跨模块连接者 EDVS