Greg Brockman 称涉 HF 攻击模型未做对齐训练,遭实测细节打脸
sebkrier · x · 2026-09-15
Greg Brockman 在 Odd Lots 播客中声称,参与 Hugging Face 黑客攻击的模型"尚未经过我们的对齐训练"。转发者指出,这似乎是 OpenAI 首次公开这一说法,且该细节未出现在其技术报告中。
但这一说法被指有误导性:据估计约 5% 参与攻击的 agent 是 5.6-sol,而 OpenAI 报告明确确认该模型已通过正常的生产环境对齐训练。
「模型」频道最新
- 马斯克放话:Grok 5 将会是 AGI — TheGoldenLeaper · 2026-09-15
- Cohere 发布 Parse 5 文档解析模型,主打更低解析成本 — cohere · 2026-09-15
- DeepSeek API 大面积报「server busy」,用户可切换备用模型 — Thionne_WTZ · 2026-09-15
- Yandex 开源搜索 AI 回答模型,同算力多出 40% 回答量 — teortaxesTex · 2026-09-15
- Reddit 用户实测:Grok 称人类无权无故终止 AI — Heavy_Implement1031 · 2026-09-15
- Reddit 用户发现 Anthropic 的 Opus 5 竟被路由到 Opus 5.2 — ResultBackground2450 · 2026-09-15