利用事故响应案例改进模型对齐可行吗?

repligate · x · 2026-08-25

推文讨论了一个有趣的问题:是否能利用过去发生的安全事故来让模型更加对齐?

Bronson Schoen 引用对 o3 模型的深度研究作为正面案例,指出最好的“模型有机体”往往来自真实的训练过程或失败的变体,这能绕过许多有效性顾虑。然而,系统卡和风险报告中常提到许多“没时间深入调查的怪异现象”,这些其实是极佳的研究候选项。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →