MMMMM: A Unified Taxonomy for Investigating the Mechanisms of Multilingual MultiModal Misinformation
Nadav Borenstein, Greta Warren, Desmond Elliott, Isabelle Augenstein
cs.CY
2026-08-30
Community Notes收2.7万条七语图文,Qwen3.5六轴打标,机制正确率79.3%,Slanted最常见。
图文一起传的不实信息比纯文本更难拆、更难拦,现成分类体系却对不齐。同一机制换一堆名字:Deepfake和AI-generated,Repurposed和Out-of-context。Dufour等人的AMMeBa已经是目前最完整的一套,按他们自己的标注,大约40%的图仍落不进预定义子类。
人工专家标得细但扩不动。众包又吃不下需要领域知识的细类。哥本哈根大学这篇把三件事绑在一起:从X的Community Notes收真实样本,做出一套六轴分类,再用视觉语言模型批量打标。
数据从Xing等人的COMMUNITYNOTES出发,丢掉社区评为无用的notes,只留英、西、葡、日、法、德、希伯来七种语言,再补官方公开的notes并抓回原帖配图。最终26,979条(用户名,文本,图像,注释)四元组,时间跨度2021年1月到2026年1月。另抽AMMeBa里「图像确实参与误导」的样本做外推检验。
分类体系先对齐已有方案的同义类,再合并近义、丢掉几乎不出现的类(如Mirrored),并在数据里补了三个旧体系盖不住的洞:科学错误或阴谋、夸大、以及「假主张写在图里、帖文只是复读」的Textual claim。最终六轴、约25个机制标签:
两条专家(论文作者)标了100条。Other mechanism几乎没人用(1条和3条),覆盖够。机制一致率65.2%,子机制56.8%,图像类型Mean Jaccard 0.6,主题0.7。情绪和修辞角色更主观,一致率更低。
打标管线用Qwen3.5 27B,六步串起来,机制那一步还拆成三轮对话:图有没有参与欺骗 → 大类 → 子类。每条跑三遍看稳定性。单次大约24小时一张L40S,非thinking模式。
抽630条英文样本做人工核对,一半标签被随机替换当干扰项。标注者之间Cohen's κ 0.67,原始一致率82.3%。去掉干扰项后,模型预测79.3%被判正确。「改图-删除」「不可靠来源-讽刺」超过90%,「Slanted-相关性误述」「假图-摆拍」掉到60%以下。搬到AMMeBa的七个对齐类别上,F1多在0.61到0.83,Time mismatch只有0.26,论文把锅部分算到提示词:同时发生时空错配时强制选地点,和AMMeBa的多标规则打架。
Community Notes上Slanted最多,超过7000条,后面是装饰性配图和Mismatch。假图和改图数量接近。AI生成和伪造文件(假证件一类)都高于多数改图子类。葡语里装饰性配图偏多,和体育、名人、娱乐扎堆有关;日语里Slanted偏多,子类指向科学错误,人工抽查看到大量伪科学地震预报。
AMMeBa的分布完全不同:Mismatch占主导,事件和身份错配最多,装饰性配图和AI生成都更少。后者可能只是采集年份更早,赶上生成图爆发之前。主题交叉上,科技与科学领域AI生成更密;疫苗相关叙事更爱用新闻截图来借权威。
这套标签把「图在骗局里具体干什么」拆开了,检测可以按机制花钱,不必对所有图文帖一刀切。Community Notes比事实核查机构覆盖的类型更杂,斜切真实照片、把假主张印在图里,这些在专业核查语料里会被低估。开源模型和代码可以直接接着跑新窗口的notes。
它还不是一个现成的检测器。管线默认notes已经指出问题,任务是给机制分类,不是从海量帖子里把不实信息捞出来。
作者列得很清楚。若干旧轴因为标不稳或需要外部知识被拿掉。很多具体叙事样本太少,AMMeBa也只是子集。Qwen3.5 27B不是最强视觉语言模型,多语言基本靠模型自带能力,没有翻译或分语种模型。机制轴是单标签,现实里一条帖可以同时错时间又错地点。两套数据里都有低质量样本,过滤仍依赖数据源自己的质量标记。
人工一致率65%说明细类边界本身就糊。79.3%的模型正确率是在「专家已经写了note」的条件下测的,换到没有note的开放检测,数字没有理由保持。