TeleAntiFraud 2.0 月度冻结基准:分类器遇近域负例 F1 从满分跌至 0.65
PPSUCTeleantifraudCommunity · hf · 2026-09-21
TeleAntiFraud 2.0 是一个可刷新的中文语音电信反诈基准,旨在解决诈骗话术快速演化的问题。其 Mixed-Tree 生成管线把线上诈骗案例摘要转化为基于画像的场景,在共享上下文下同时生成欺诈与非欺诈对话路径,渲染为角色匹配的语音,并按月冻结音频、标签、prompt 与溯源记录。每套冻结集含 900 条中文通话(600 条欺诈 + 300 条近域合法通话)。
关键发现:三个分类器在无关或普通负例下 Macro-F1 满分,但换到近域同类负例后骤降至 0.65–0.68;全量音频与 ASR+LLM 评测还暴露出类别先验捷径、预测坍缩与快照敏感等问题。作者主张「近域负例构建」与「感知坍缩的报告方式」应成为语音反诈模型评测的核心要求。数据集与代码已开源。
「研究」频道最新
- GEPA 优化提示词,把 Jev 医学文献任务 F1 从 69.1% 提到 79.7% — matei_zaharia · 2026-09-21
- 把哲学体系变成可执行的 RL 目标,才是价值对齐的真问题 — willcb · 2026-09-21
- 图解循环结构:从 Amari-Hopfield 网络一直讲到 GPT-6 Astra — gklambauer · 2026-09-21
- Anthropic 在湾区建生物湿实验室,让 Claude 指挥机器人做药物研究 — FinanceYF5 · 2026-09-21
- DraftTrace:从过程而非结果评估学生 AI 时代学习 — keviv9 · 2026-09-21
- Matthew Berman 探讨:这只仿真果蝇到底算不算「真」 — Matthew Berman · 2026-09-21