对齐论文被指默认可纠正性
repligate · x · 2026-07-12
这条转发在吐槽一类“看起来不错、细看却默认模型可纠正(corrigible)”的论文:作者认为论文把当前模型与对齐技术描绘成更成功、更普及的控制方案,但实际上并非如此。引用评论进一步指出,论文没有认真处理 **coherence tax**,这种写法也迎合了实验室、AGI 担忧者和政府关系团队各自想要的叙事。
「漫话AGI」频道最新
- Robin Hanson:美国发明近两世纪来越来越不相似 — sebkrier · 2026-07-21
- Gary Marcus 支持的“AI 版 CERN”主张建立国际前沿模型监督机构 — GaryMarcus · 2026-07-21
- Gyges 定律式判断:AI 争论的关键可能是人们信不信结果 — mimi10v3 · 2026-07-21
- 作者认为,AI 时代将由个体小生意放大影响力 — tobowers · 2026-07-21
- 一位 AI 怀疑论者称技术有用,但过度依赖与版权滥用都是真风险 — ZeroStateReflex · 2026-07-21
- Tyler Cowen:未来将由青少年 AI 狂热者推动 — Polymarket · 2026-07-21