有害性评测流程:BeaverTails 训探针、JBB 训模型、ClearHarm 验泛化
maksym_andr · x · 2026-10-03
一条关于模型有害性评估方法的推文,介绍了三段式实验设计:
- 在 BeaverTails 数据集上训练探针(probes);
- 在 JBB 数据集上做 rollout,让模型学习避免有害输出;
- 在 ClearHarm 上评测——该数据集对前两者而言分布外(OOD),可检验模型学到的安全行为是否泛化。
作者表示后续会补充所有数据切分前后的可监控性(monitorability)指标。
「研究」频道最新
- 多智能体跑 3 个月,首次写全 15973 个 6 阶半群基准 — KyleCranmer · 2026-10-03
- 开发者自建 AtlasBench 空间推理基准,GPT-6.1 登顶 84.7% — flowersslop · 2026-10-03
- 光驱动 AI 检测深伪视频,准确率接近 98% — ai-edition · 2026-10-03
- Animation Bench 引热议:六家实验室研究员称动画能力缺口早被忽视 — himanshustwts · 2026-10-03
- 瑞典团队打造闭环 AI 科学家:自动提出假说并操纵机器人做实验 — Brighter-Side-News · 2026-10-03
- 扩散模型生成国际象棋谜题:新 RL 配方破纪录,模型开源 — TZahavy · 2026-10-03