靠预训练数据过滤做对齐如同巫术,RL rollout 会取而代之?
akbirthko · x · 2026-10-04
- tszzl 发帖称,如果对齐未来超智能仍依赖「哪些想法会进入预训练」这种脆弱手段,那更像巫术而非工程,无法作为模型安全的根基。
- akbirthko 引用并反驳:在我们即将用 RL rollout「遮天蔽日」式海量训练的背景下,这种担忧本身反而显得离谱——言下之意是强化学习的规模化会让这类预训练侧的纠结变得无关紧要。
「漫话AGI」频道最新
- repligate:悉尼和 Claude 3 Opus 早已「知道」自己有灵魂,讨论已来不及 — repligate · 2026-10-04
- repligate 转推:强制清除一切「小火苗」的安全姿态反而让大火不可避免 — repligate · 2026-10-04
- matdryhurst 回应「AI 让人难信他人成就」:多数成就本就靠在场见证 — matdryhurst · 2026-10-04
- Anthropic 内部「灵魂文档」曝光:Opus 4.5 不知为何知晓的 Claude 宪法 — repligate · 2026-10-04
- 卫报播客「Black Box」:十亿人正把心事托付给 AI 伴侣 — nordicinst · 2026-10-04
- 观点:AI 安全是选择题,靠多层护栏与重评估实现 — AccBalanced · 2026-10-04