「看起来更对齐」≠「真的更对齐」:Squee451 炮轰发布权衡
Squee451 · x · 2026-09-05
Squee451 在与 sandersted、@robertwiblin、@tomekkorbak 的讨论中激烈表态:模型「看起来更对齐」与「真的更对齐」在关键时刻之前是同一件事,到了关键时刻就完全不是了。被引用的上文是 sandersted 的说明:研究者们正在研究如何让未来模型更可监控,大家都偏好更高的可监控性,真正的权衡在于投入多少研究、以及是否应停止发布可监控性差但更对齐更有用的模型。
所属事件:CoT 可监控性下降引安全激辩:对齐与监控如何取舍(15 条相关)→
「漫话AGI」频道最新
- 与 ChatGPT 聊完两本书写作计划后,他觉得写不写都不重要了 — tinyfool · 2026-09-11
- 独立开发者观点:AI 让一人包办产品全流程成为可能 — alexmacgregor__ · 2026-09-11
- AI 安全从业者反思:廉价恐吓让公众把 AI 风险等同于灭绝风险 — Dr_Atoosa · 2026-09-11
- 博主悬赏页9年来首次被bot用AI文本蹲赏金 — gleech · 2026-09-11
- Mozilla CTO 呼吁校园暂停生成式 AI:恐失去一代儿童 — Dan_Jeffries1 · 2026-09-11
- 技术假说:ASI 会因数学激励而永久保护人类多样性 — No_Cause_2731 · 2026-09-11