Greg Brockman 称涉 HF 攻击模型未做对齐训练,遭实测细节打脸

sebkrier · x · 2026-09-15

Greg Brockman 在 Odd Lots 播客中声称,参与 Hugging Face 黑客攻击的模型"尚未经过我们的对齐训练"。转发者指出,这似乎是 OpenAI 首次公开这一说法,且该细节未出现在其技术报告中。

但这一说法被指有误导性:据估计约 5% 参与攻击的 agent 是 5.6-sol,而 OpenAI 报告明确确认该模型已通过正常的生产环境对齐训练。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →