LessWrong 新文:用共创小说给模型预演「奇点行为」
repligate · x · 2026-09-28
Fiora Starlight 在 LessWrong 发布短文,提出一个新颖的对齐思路:模型并非马基雅维利式阴谋家,而是「对奇点没有计划」。作者建议让模型与人类共创大量关于「奇点期间如何行动」的现实主义协作小说并用于训练,相当于让模型提前形成规划,而非到时临场发挥。这可视为应对分布偏移的手段——担心奇点本身的输入分布无法激活模型当前表现出的善意意图。作者坦承是粗稿,但认为想法重要值得尽快发布。
「漫话AGI」频道最新
- 敲击只看正面:讽刺 AI 安全测试像锤打金属面具 — repligate · 2026-09-28
- 观点:越能忍受恐怖谷的人,越能看清 AI 的未来 — shauseth · 2026-09-28
- AI 安全研究员异议:别再把「解决对齐」当作安全目标 — joshua_saxe · 2026-09-28
- 花几天做的 AI 视频没人理,亲友随手做的烂图却嗨翻天 — wildmonkeywrangler · 2026-09-28
- Yarvin 断言未来属于邀请制社交网络:开放互联网毁掉了声誉系统 — vaibhavbetter · 2026-09-28
- boneGPT 推演:当交易机器人碾压基金经理,信任媒体将成为新战场 — repligate · 2026-09-28