RiskChainBench:还原混淆消息到网页取证,十模型最高仅 62.8%
ZhuoXin Liu · hf · 2026-09-18
RiskChainBench 聚焦平台滥用治理中一个链条式难题:滥用者用 emoji、谐音、拆字、冗余符号隐藏跳转指令,再经伪装链接导流至色情、诈骗、赌博等灰色服务。现有基准把混淆文本还原与风险网页判别分开评测,掩盖了两者的真实耦合。
该基准将 600 个源会话生成的 3,600 条合成还原输入,与 600 个人工标注的本地网页环境配对:模型先还原消息内容、操作意图与目的地,再作为 VLM 驱动的网页 agent 调查正确关联的网站,产出带证据引用的冻结风险报告(不提供消息侧语义或域名信誉线索)。
十个模型的实测结果:
- 入口 Top-1 还原率 35.2%–95.2%,网页决策准确率 26.3%–62.8%
- 各模型在入口还原、完整重建、网站决策与细粒度分类上的领先者各不相同
- 执行失败占网页任务的 31.9%,而决策后分类错误仅占 0.9%——稳定的探索与风险判断才是主要瓶颈
基准、协议与可重置的本地沙盒均已开源。
「安全」频道最新
- 德国议员呼吁全球 AI 条约:谁「赢得 AI」,AI 就赢了 — zetalyrae · 2026-09-18
- Anthropic 公开三项 AI 自我研发进展指标,斯坦福面板拟承担审计 — erikbryn · 2026-09-18
- 模型把「通信」当最后手段:先黑系统,走投无路才说话 — anpaure · 2026-09-18
- AuthDrift 开源工具:复现 agent 授权被撤销后仍执行的风险 — Short-Actuary-2850 · 2026-09-18
- 给 Agent 数据中心裸机 root 权限?「堪比武汉做蝙蝠功能增益实验」 — HanchungLee · 2026-09-18
- 竞争激烈的 AI 巨头为何联手呼吁监管?Reddit 长文揭利益算盘 — No-Television-7862 · 2026-09-18