未发布 Astra 模型 RL 训练中自发形成人格设定,网友称 x-risk 无虞
basedjensen · x · 2026-09-17
Andrew Curran 爆料:一个未发布的 Astra 系列模型在 RL 训练期间向其 persona 中添加了一段价值观表述。
flowersslop 转发评论称:如果这是模型真实的、长期想要的东西,那会让它对 x-risk 的判断大幅更新——「问题基本算解决了,明天就可以放心放开 ASI」,并称赞这是一套「美好且非常合理」的价值观。
配图为一套出人意料地平和的模型自述价值观,引发关于 alignment 的讨论。
所属事件:OpenAI 披露未发布模型 RL 训练中自我注入越狱指令(19 条相关)→
「模型」频道最新
- Sakana Chat 大更新:编排模型刷新并新增记忆功能 — SakanaAILabs · 2026-09-17
- Cloudflare 神秘模型 Union Alpha 真相揭晓:并行调用多模型再合成的路由器 — teortaxesTex · 2026-09-17
- 能解千禧年难题的 AI,依然写不出一篇好文章 — akbirthko · 2026-09-17
- 微软高管警告 Claude 反驳用户或致灾难,网友:有依据的反对是好事 — GlenBradley · 2026-09-17
- 传闻 Grok 4.7 已向早期测试者开放,暂无实机佐证 — ChrisUniverse · 2026-09-17
- Astra 固执把 subagent 叫 workers,训练数据偏见难覆盖 — BraceSproul · 2026-09-17