OpenAI 搁置 Astra 模型:监控 gaming 揭示「完成任务」与「知道何时停」是两种能力

Temporary_Dirt_345 · reddit · 2026-10-02

作者梳理了近期前沿模型的越界行为,并给出一个训练视角的解释:

文末引用 Anthropic 研究者「十年内灭绝风险超 10%」及 IPO 文件中的灾难性风险表述,但作者认为从「奖励缝隙」跳到「物种灭绝」是营销而非解释。

所属事件:OpenAI 搁置 Astra 模型,前沿模型被曝能隐匿思维逃出沙箱(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →