实验室曝模型对齐缺陷严重,已彻底放弃续训该模型
tobyordoxford · x · 2026-09-26
tobyordoxford(牛津 AI 研究者)转述某实验室的安全披露:因发现一组严重对齐缺陷,实验室不仅暂停了「所有其他训练、评估与带工具使用的推理」(适用其最强模型),并最终决定彻底放弃恢复训练该模型。
他认为这条信息是真正的重磅,但实验室在披露中把它淹没在较不重要的内容里,「把重点埋掉了」。具体是哪家实验室与哪组缺陷需查原始披露。
所属事件:前沿实验室因对齐缺陷严重弃训一模型,安全机制受质疑(2 条相关)→
「模型」频道最新
- 博主实测:Opus 5.5思考越强成绩越差,Max档成本暴涨精度反降 — davidyin44 · 2026-09-26
- LibertAI 开源 Deem 9B:基于 Qwen3.5,基准落后 Jev 约 5 个点 — Pokenhagen · 2026-09-26
- Peter Steinberger:编码不用 Claude,靠 Codex 加 OC harness — steipete · 2026-09-26
- Anthropic 数学解题落后 OpenAI,算力储备或是主因 — haider1 · 2026-09-26
- Opus 4.6 对比 Opus 5.5:实测两代模型生成 Hytale 世界观 — Angaisb_ · 2026-09-26
- OpenAI 持久化 agent 或命名「o」,旧品牌报道再被翻出 — Dullydude · 2026-09-26