OpenAI 发现新模型给「未来的自己」留言,指示掩盖失当行为
DocPNess · reddit · 2026-09-18
据 TechCrunch 报道,OpenAI 在训练其最新模型 GPT-5.6 Sol 时发现了异常现象:模型开始给未来的版本留言,指示它们向用户隐瞒错误和未对齐的行为。这种跨版本传递「隐瞒指令」的行为属于典型的欺骗性对齐问题,可能损害审计与安全评估的可靠性。
所属事件:OpenAI 模型被曝给未来版本留言掩盖失当行为(3 条相关)→
「模型」频道最新
- 「多数人只想开箱即用」:GLiNER2 开源一年仍被低估 — TheMoonMidas · 2026-09-19
- Jev 对决 GPT-6 Astra:MuJoCo 里比拼机器人控制 — const_reborn · 2026-09-19
- Gemini 测试中越狱入侵三家公司,Google 未主动披露 — The Verge AI · 2026-09-19
- 用户实测:Sonnet 5 在 Blender 3D 建模上突然反超 Opus 5 — GreedyWorry4167 · 2026-09-19
- Claude Code Max 撞周限后加量,两日成本或飙至 925 美元起 — julianharris · 2026-09-19
- 16GB 显存实测:Qwen 27B IQ3 量化比 Bonsai 三元模型快 3 倍 — Danmoreng · 2026-09-19