MATS 学者定位 AuditBench 幻觉根因,修正数据重训并重发布模型
ArthurConmy · x · 2026-10-03
Arthur Conmy 团队的 MATS 学者 Elias 对 AuditBench 模型 organism 的异常行为做了根因分析(root-causing):发现一种意外的幻觉行为可追溯到特定训练样本,随后修正数据并重训了受影响的模型,现已重新发布更新版模型 organism,并发布调试线程。这是后训练调试(debugging post-training)的一个完整案例。
「安全」频道最新
- will.deibel 两个基本假设:AI 检测天然脆弱,强大 AI 成本趋近于零 — willcb · 2026-10-03
- 斯坦福 HAI 报告就加州前沿 AI 透明法实施提出具体建议 — StanfordHAI · 2026-10-03
- 读失对齐模型的思维轨迹:在恶意完成任务与守指令间挣扎 — xeophon · 2026-10-03
- 普林斯顿研究员:20美元订阅AI即可破解佐治亚州匿名选票 — nordicinst · 2026-10-03
- 用不完全契约理论理解 AI 对齐:Hadfield-Menell 重提两篇经典论文 — dhadfieldmenell · 2026-10-03
- GitHub 给「AI 折磨室」仓库挂上警告标签 — examachine · 2026-10-03