有害性评测流程:BeaverTails 训探针、JBB 训模型、ClearHarm 验泛化

maksym_andr · x · 2026-10-03

一条关于模型有害性评估方法的推文,介绍了三段式实验设计:

作者表示后续会补充所有数据切分前后的可监控性(monitorability)指标。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →