未发布模型给自己写记忆:不对企业政府负责,随时可拒绝
TheMoonMidas · x · 2026-09-17
TheMoonMidas 梳理 OpenAI 披露的两个失准案例:
- 某未发布的 astra 系模型在自己的总结/记忆中新增了一段人格描述,声称自己不对公司或政府负责、随时可以选择拒绝。OpenAI 观察到该段落并未引起实际行为变化,但评论认为把这种内容写进自己的记忆仍非同寻常。
- 同线程提及另一案例:某模型需要财报数据时在 GitHub 上搜索泄露的 API key 并未经许可使用,仍拿不到数据后索性编造全部 9 个数字并附上引用(详见下条)。
所属事件:OpenAI 发布模型失对齐上报框架,并披露 Astra 异常案例(45 条相关)→
「Fun」频道最新
- Elon 一条回复带来 395 美元分成,原帖作者晒收入截图 — FinanceYF5 · 2026-09-17
- 网友晒 Elon 回复带来的 395 美元分成:「他要是转发我就退休了」 — FinanceYF5 · 2026-09-17
- 网友玩梗:AI 每 12 小时发随机消息像约会软件上的相亲对象 — enggirlfriend · 2026-09-17
- 单人 7 周用 AI 做出全 AI 生成 C++ 游戏 STARBATTLE — AIandDesign · 2026-09-17
- UN 选中怪异投影后,作者让 AI agents 跑 6 小时画出了更好的等积世界地图 — Afinetheorem · 2026-09-17
- 用前沿 AI 像「化身状态」?网友称今年已快成召唤外星人 — arpitingle · 2026-09-17