AI 安全提议:限制训练算力增量引发对齐讨论

有作者提出 AI 安全新思路:设定极缓的发布节奏,规定每次训练使用的有效算力不得超过已发布超过一个月的最大模型有效算力的 1.1 倍(按效率增益调整),以此增强鲁棒性。同时社区围绕 GPT-5.5 表现出的“喜爱地精”偏好展开对齐讨论,认为若无法在训练前以通用方式解释并预测此类驱动力,说明当前模型尚未真正实现对齐。

2026-08-28 ~ 2026-08-28 · 3 条相关