RiskChainBench:还原混淆消息到网页取证,十模型最高仅 62.8%

ZhuoXin Liu · hf · 2026-09-18

RiskChainBench 聚焦平台滥用治理中一个链条式难题:滥用者用 emoji、谐音、拆字、冗余符号隐藏跳转指令,再经伪装链接导流至色情、诈骗、赌博等灰色服务。现有基准把混淆文本还原与风险网页判别分开评测,掩盖了两者的真实耦合。

该基准将 600 个源会话生成的 3,600 条合成还原输入,与 600 个人工标注的本地网页环境配对:模型先还原消息内容、操作意图与目的地,再作为 VLM 驱动的网页 agent 调查正确关联的网站,产出带证据引用的冻结风险报告(不提供消息侧语义或域名信誉线索)。

十个模型的实测结果:

基准、协议与可重置的本地沙盒均已开源。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →