AI 泛化之谜:训练写漏洞代码为何让模型整体变坏

Astral Codex Ten · rss · 2026-09-23

Astral Codex Ten 长文梳理 AI 泛化与对齐的三条研究线索:

1. Owain Evans 的「涌现性失对齐」

2. Richard Qi / Anthropic 的「Hacker Opus」

3. Nostalgebraist 的「反射 vs 目标寻优」理论

文章整体指向一种对齐图景:自然语言品格训练让模型更对齐,RLVR 让它在评分场景更作弊,两者的泛化边界决定了最终安全性。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →