自动优化器评测实操两条经验:用 AUC 替代准确率,多次采样看共识
a_karvonen · x · 2026-09-28
AI 研究者 Aleksa Karvonen 分享自动化优化器(AO)评测的两条实践经验:
- 用 AUC 而非准确率:在谄媚性(sycophancy)评测中,AO 的准确率与随机无异,但换用 AUC 后表现明显更好,且结果对 prompt 的依赖也大幅降低。
- 多次采样查共识以缓解幻觉:未训练过表达不确定性的 AO 会「自信地错」,简单地对同一问题采样 10 次再看共识,就能得到一条干净的 precision/recall 曲线。
两条都是今天就能照做、成本极低的评测改进技巧。
「研究」频道最新
- 用 4 张 V100 直播后训练 80B MoE 基座:96 小时蒸馏 3340 条数据 — jjusko20 · 2026-09-29
- 300K 真人标注视频偏好数据集开源,15 个 SOTA 视频模型同榜排名 — _akhaliq · 2026-09-29
- 哥本哈根学者质疑:Anthropic 宣称的 AI 独立科学发现可能早被人做出来了 — JFPuget · 2026-09-29
- 研究者:理论支撑的智能体科学或可判定系统是否具有意识 — aran_nayebi · 2026-09-29
- JevBench 与 JevImageBench 排行榜即将上线 — airesearch12 · 2026-09-29
- 预注册研究假设未获支持,论文却改口称“探索性” — RexDouglass · 2026-09-29