CogVis: Must Open-Vocabulary Change Detection Perceive the Scene Anew for Every Query?
开放词表变化检测不必每次查询都重新感知场景:CogVis在七个基准上全面最优:如果你在做多类别遥感变化检测,每次新增查询类别都要重跑整套图像对解析,推理成本会随查询数线性增长。CogVis把这件事拆开了:它用感知-记忆-验证三阶段框架,让类别无关的场景感知只算一次、跨查询共享,在七个基准上全面达到最优,推理吞吐量提升28.50%。
现有M-C-I和I-M-C管线把时序感知、语义判别和区域验证耦合在固定级联里,每次查询都重复计算类别无关的双时相特征;CogVis改为感知-记忆-验证三阶段:SCP提取可复用的变化先验,SMC动态校准阈值,ARF验证候选区域。在语义变化检测、二值变化定位、建筑损毁评估共七个基准上,CogVis全面达到最优,推理吞吐量提升28.50%。
开放词表变化检测无需为每次查询重感知场景:类别无关的时序先验提取一次后跨查询共享,语义决策交给记忆校准和区域验证完成。CogVis凭此在七个基准上全面最优,推理吞吐量提升28.50%。
1. 旧假设与失败:M-C-I共享类别无关候选,但错过的候选无法恢复,虚假候选仍可能拿到合理标签;I-M-C为每次查询重新解析图像对,时序计算随查询数线性叠加;两者都把时序证据、语义不确定性和区域可靠性绑死在固定级联里。 2. 方法与受控检查:SCP从冻结骨干提取类别无关变化先验并跨查询共享;SMC检索记忆案例、对比邻近混淆类别,动态估计图像-查询专属阈值;ARF以语义、时序、结构三维可靠性过滤候选,排除阴影、纹理变化、季节偏移、配准误差;在七个基准上跨三类任务对比M-C-I和I-M-C。 3. 决定性结果与行动:CogVis在全部七个基准上最优,共享感知带来推理吞吐量+28.50%;做系统时把双时相特征提取做成共享模块,别为每个查询重跑完整管线。
评测覆盖七个基准,任务包括语义变化检测、二值变化定位和建筑损毁评估。基线涵盖M-C-I(共享类别无关候选,但定位误差向下传播,错过的候选无法恢复,虚假候选仍可能获得合理标签)和I-M-C(注入类别先验,但每次查询重复解析图像对)。关键效率指标是推理吞吐量提升28.50%,来自跨查询共享场景级感知。所提供摘录未给出具体数据集规模、各基准分项量化指标和消融实验细节。
- 它要解决什么
- 现有OVCD方法把时序感知和语义判别耦合在一起,每次查询都重复计算双时相图像对的特征。能不能把类别无关的场景感知和查询专属的语义决策解耦,同时提升效率和稳定性?
- 研究路径
- SCP从冻结的双时相骨干特征中提取类别无关变化先验,生成跨查询可复用的场景级变化图。SMC对每个查询检索记忆案例、对比邻近的语义混淆类别,动态估计图像-查询专属的决策阈值,补偿类别相关的分数偏移。ARF用语义、时序、结构三维可靠性给连通候选区域打分并过滤,排除阴影、纹理变化、季节偏移和配准误差等非语义干扰。
- 这对工程意味着什么
- 第一步行动:构建多类别开放词表变化检测系统时,优先把类别无关的双时相特征提取做成跨查询共享模块。要避免的捷径:不要为每个语义查询重跑完整图像对解析管线——这是I-M-C的常见代价,推理成本会随查询数线性增长。
- 证据定位
- CogVis在七个基准上全面达到最优。共享的场景级感知避免了跨查询的重复时序计算,推理吞吐量提升28.50%。相比M-C-I(定位误差会向下传播)和I-M-C(每次查询重复解析图像对)两种管线,CogVis均取得改进。(筛选维度:可复核评测)
- 适用边界
- 所提供摘录未披露七个基准的具体数据集规模和各基准分项指标;SMC记忆库的构建与维护方式、ARF三维可靠性信号的训练监督细节、以及多查询共享感知对单查询场景精度的影响,均未在摘录中充分呈现。
方法与英文摘要
CogVis包含三个模块。第一,场景变化感知器(SCP)从冻结的双时相骨干特征中提取类别无关的变化先验,这份先验跨查询共享。第二,语义记忆校准器(SMC)检索记忆案例、对比邻近的语义混淆类别,为每张图像和每个查询动态估计专属决策阈值。第三,自适应区域滤波器(ARF)用语义、时序、结构三维可靠性过滤连通候选区域。评测覆盖语义变化检测、二值变化定位、建筑损毁评估共七个基准,对比M-C-I和I-M-C两种管线。
Earth-surface monitoring requires change detection models capable of recognizing arbitrary semantic categories. Open-Vocabulary Change Detection (OVCD) addresses this need. However, existing methods often entangle temporal perception, semantic discrimination, and region verification, causing unstable results and redundant computation. Inspired by human visual change perception, we propose CogVis, a cognitive memory-guided framework that reformulates OVCD as a perception-memory-verification paradigm. CogVis first employs a Scene Change Perceptron (SCP) to extract a reusable, category-agnostic change prior from frozen bi-temporal features, thereby decoupling temporal evidence from semantic category decisions. A Semantic Memory Calibrator (SMC) then compensates for category-dependent score shifts by dynamically estimating an image-query-specific decision threshold. Finally, an Adaptive Region Filter (ARF) filters connected candidates using learned semantic, temporal, and structural reliability. Experiments on seven benchmarks spanning semantic change detection, binary change localization, and building-damage assessment show that CogVis achieves state-of-the-art performance across all evaluated datasets. By sharing scene-level change perception, CogVis further avoids repeating category-agnostic temporal perception across queries and improves inference throughput by 28.50%.