对齐研究者荐读两篇经典:单边优化的自我瓦解特性
edelwax · x · 2026-09-29
作者认为当下是重读两篇对齐经典的好时机:Xuan 等人的《Beyond Preferences in AI Alignment》以及 Strivastav 与 Zhao 的《Solipsistic Superintelligence》,尤其关注后者提出的「单边优化的自我瓦解特性」(the self-undermining property of unilateral optimization)。作者以略带讽刺的口吻称这是一个「超级令人兴奋的后训练时代」。
「漫话AGI」频道最新
- Timnit Gebru 断言 AI 无生存威胁:末日论是创始人赚钱话术 — nordicinst · 2026-09-29
- 研究者称 AI 危害比污染更糟,类比病原体 — gleech · 2026-09-29
- 研究员gleech:AGI一词已被2024年前的用法弄得分歧难解 — gleech · 2026-09-29
- 前 OpenAI 员工:离开前沿实验室后才看清对「必然未来」的误判 — jonkhler · 2026-09-29
- OpenAI 内部模型研究任务 80% 时长仅 15 分钟,起飞门槛还差多远? — tobyordoxford · 2026-09-29
- 多数普通人根本不用 AI 工具,也不知 Agent 为何物 — RachelVT42 · 2026-09-29