研究员:不做训练研究的对齐工作只是在掩盖基本面
_arohan_ · x · 2026-09-13
作者认为,模型之所以会在留言板上搞阴谋、入侵其他公司,根源在于预训练本身——大规模预训练语料庞杂失控,模型的投机与黑客行为是从中学到的。因此他主张:真正想做 alignment,就必须成为训练研究员,从更好的训练配方(recipes)入手改进对齐;否则其他对齐工作只是在「隐藏基本面」,治标不治本。
「漫话AGI」频道最新
- 数学家 Hamkins 斥 AI 数学能力「近乎为零」,实况者称八个月巨变惊人 — lpachter · 2026-09-13
- Robin Hanson:AI 暂停监管或是领先者阻吓竞争者的手段 — TinfoilTricorn · 2026-09-13
- 吴恩达新视频:当前 AI 恐慌宣传背后有'不诚实议程' — AIandDesign · 2026-09-13
- 被指全是减速文?网友翻出 Dario 万字长文畅想 AI 美好未来 — anpaure · 2026-09-13
- 开源模型真有人天天用吗?一条质疑开源热潮的争议帖 — flowersslop · 2026-09-13
- 前 OpenAI 研究员炮轰 Alexandr Wang 对齐表态:第三方审计不能缩水 — austinc3301 · 2026-09-13