- 3 次围观
科学图像序列通常包含外观和动态特征未知的重复结构。传统方法使用预定义模板、噪声模型或运动类别,在目标已知时表现良好;然而,在探索性分析中,发现这些知识本身才是主要目标,此类假设可能反而构成限制。本文提出了一种自监督框架,将噪声视频映射为由局部状态及其时空关系构成的离散词汇。该方法无需干净目标、预训练表征、语义标签、特征模板或预先设定的轨迹,仅假设具有信息量的结构会在有限时长内、有限的空间邻域中重复出现。一个经过时间掩蔽的向量量化网络利用相邻帧预测缺失的中心帧;同时,一个掩蔽式 Transformer 通过权衡编码器证据与上下文兼容性,对标记分配进行细化。针对具体项目的标记集合定义了特征族,而支持模型则量化单个出现实例的时间证据,从而支持可选的保守性抑制。该框架首先在移动粒子的合成视频上进行了验证。在学习和筛选过程中均无法获取干净帧或粒子坐标的情况下,所学习到的状态仍能恢复出紧凑的、类似点扩散函数的结构。在低信号粒子跟踪基准上的测试表明,逐帧组分精确率介于 87.0% 和 94.5% 之间,而随着粒子密度升高,召回率逐渐下降。进一步以大肠杆菌为例的实验表明,离散状态能够将生物结构与照明及采集伪影区分开来。在所有情况下,主要输出均为具有可解释性的状态图、活动图、支持图和组分图;渲染图像仅作为诊断工具,而非优化目标。
科学图像序列通常包含外观和动态特性未知的重复结构。传统方法依赖预定义模板、噪声模型或运动类别,在目标已知的情况下表现良好;然而,在探索性分析中,发现这些知识本身才是首要目标,此类假设可能反而造成限制。本文提出一种自监督框架,将含噪视频映射为由局部状态及其时空关系构成的离散词汇表。该方法不依赖干净目标、预训练表征、语义标签、特征模板或预设轨迹,仅假设具有信息量的结构会在有限时长内、于有界空间邻域中重复出现。一个时间掩码向量量化网络利用相邻帧预测缺失的中心帧;同时,一个掩码 Transformer 通过权衡编码器证据与上下文兼容性,进一步优化令牌分配。针对具体项目的令牌集合定义了特征族,而支持度模型则量化单个出现实例的时间证据,从而实现可选的保守抑制。该框架首先在移动粒子合成视频上进行了验证。在学习和筛选过程中均未使用干净帧或粒子坐标的情况下,所学习到的状态能够恢复出紧凑的、类似点扩散函数的结构。在低信号粒子跟踪基准上的测试表明,帧级分量精确率介于 87.0% 和 94.5% 之间,而随着粒子密度升高,召回率逐渐下降。以大肠杆菌为对象的实验示例进一步表明,离散状态能够将生物结构与照明及采集伪影区分开来。在所有情况下,主要输出均为可解释的状态图、活动图、支持度图和分量图;渲染图像仅作为诊断工具,而非优化目标。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.17.751938v1?rss=1
🏷️ 自监督学习 时空表征学习 离散状态建模 噪声图像分析 粒子跟踪
来源出处
噪声图像序列中离散局部状态的自监督发现
https://www.biorxiv.org/content/10.64898/2026.09.17.751938v1?rss=1