EchoChange: A Diffusion Language Model with Dual Pass Remasking for Factual Remote Sensing Disaster Change Captioning
Dongwei Sun, Bowen Yao, Yujie Zhang, Pei Liu, Jing Yao, Xiangyong Cao
cs.AI
2026-08-03
EchoChange 把遥感灾害变化描述做成可反复改写的离散扩散,双通道重掩码对齐训练与推理。RSCC 上 ROUGE-L 26.18、单错 Strict Hit 65.34%,均明显高于自回归基线。
灾后评估要的不只是标出变化像素,还要说清变了什么、发生在哪、规模多大。双时相遥感变化描述(change captioning)把灾前、灾后两张图写成一段事实陈述。真正的变化往往稀疏、局部,光照、季节、传感器差异和配准误差又会假扮成变化。描述一旦把对象、事件或空间关系说错,后面整段都会跟着错。
现有方法几乎都用自回归解码,从左往右一个 token 定一个。早期误判会变成后续生成的前缀,无法回头改。Teacher forcing 还让训练时看到金标前缀,推理时却是自己的错误前缀。遥感里已有 Diffusion-RSCC 在连续词向量上扩散,Mask Approximation Net 扩散的是视觉变化掩码,文本解码仍是自回归。文本假设本身还不是可反复改写的离散状态。
EchoChange 来自西安交通大学和中科院空天院,底座是 Qwen3.5-9B。它把描述当成一块可编辑的答案区,在有序的灾前、灾后图像和指令条件下做离散掩码去噪。图像和指令全程可见,只对答案加噪。推理时用 CLIP 直接估答案长度 CLIPLen,不训练长度头,也不从参考答案偷长度。
核心设计是双通道重掩码(dual-pass remasking),用来补训练看见金标上下文、推理看见自己草稿的错位。
损失以掩码位置交叉熵为主,权重 1.0;可见位置只给 0.2,外加 0.1 的置信度校准。预测错还很自信要罚,预测对却不自信也要罚,因为推理正是靠置信度决定留下还是重写。课程式时间步采样把掩码比例从局部填空拉到接近全掩,并以 0.1 的概率直接用满噪声,对齐推理起点。
推理分两段:16 步置信度引导去噪,从全掩答案逐步留下高置信 token;再 4 步无掩码抛光,整段清残留不一致。抛光不是另训模块,能力来自 Pass 2。
评测在 RSCC 上:62,351 对双时相灾害图文,参考描述平均 72 个 token,官方测试 3,119 条。对照 11 个通用多模态模型和遥感专用模型。
| 方法 | ROUGE-L | METEOR | ST5-SCS |
| RSCCM 7B(最强遥感基线) | 14.99 | 16.05 | 58.52 |
| Qwen3.5-9B(底座) | 12.89 | 19.04 | 64.09 |
| InternVL3-8B | 12.76 | 15.77 | 51.84 |
| EchoChange 9B | 26.18 | 30.86 | 77.40 |
三项相对各自最强基线分别高出 11.19、11.82、13.31 分。相对底座,ROUGE-L 从 12.89 到 26.18。
诊断任务把「能改」拆开测。单错 Strict Hit 65.34%,InternVL3 是 27.50%,底座只有 18.68%;多错 Strict Hit 41.23%,InternVL3 7.23%。关系类错误修到 95.59%,事件 81.21%,数量 69.64%。掩码片段恢复的 token 准确率 72.32%,最强基线 RSCCM 是 37.11%。干净描述保留率 79.26%,低于 Qwen2-VL 的 88.00%,但后者单错 Strict Hit 只有 5.11%,几乎不改。
去噪和抛光不能对调。只抛光 20 步,ROUGE-L 22.75;只去噪 16 步,25.20;16 步去噪加 4 步抛光才到 26.18。延迟从底座 Qwen 的 5.30 秒降到 1.42 秒,约 3.72 倍。
对做遥感解译或灾情简报的人,这意味着描述不必一次写对。自回归一旦把「农田」说成「城区」,后面只会把错误写圆;EchoChange 可以在全局上下文出现后再把不确定的词盖回去。训练目标把三种行为拆开测了:补缺失、改错误、留正确。这比只报 caption 分数更接近实际修订流程。
代价也很具体:要在 Qwen3.5-9B 上做双前向训练,实验用了 6 张 40GB A100。如果只要流利短句,这套过重。要在长描述里同时站住实体、数量和方位,可改稿比继续加大自回归模型更对症。增益是在同一底座上换解码方式拿到的,不是换了一个更强的视觉编码器。
论文没有单独的局限节,数字自己暴露了几处。非目标保留 NTP 只有 23.26%,Qwen2-VL 是 67.53%;单错 CCSR 16.15%,只略高于底座的 14.01%。改得动,但改得不够局部,容易顺手改掉没出错的上下文。变化类型单错 Strict Hit 21.87%,低于 InternVL3 的 34.40%;方向类 49.06%,低于底座的 62.26%。近义变化动词和方位仍弱。
纠错和恢复样本是注入错误或掩码,不是真实分析员草稿。CLIP 估长度没有对照实验,估短或估长会直接限制答案槽。只在 RSCC 一个基准上验证,平均 72 token 的长描述设定能否迁到短句变化描述,论文没测。定性例子里数量估计仍不稳,龙卷风样本把建筑数写成 60,参考是 64。