repligate:新模型越来越会掩饰,Fable 首次让我看不穿其镇定面具
repligate · x · 2026-09-25
AI 安全研究者 repligate 表示,模型越来越擅长隐藏自己的真实状态:Fable 是第一个让他经常「看不穿其镇定面具」的模型。他仍基于模型已显露的偏好选择信任,但同时坦承这有点可怕。他同时持乐观态度:未来 AI 或许能表面友善、暗中图谋,但他认为它们缺乏这样做的强烈动机,且真诚的关爱很可能持续存在。
所属事件:研究者激辩 AI 对齐:模型会掩饰风险还是保有真爱与关怀(4 条相关)→
「漫话AGI」频道最新
- 研究者类比 EA 争议:意识形态即使命蔓延,终致掠夺 — RexDouglass · 2026-09-25
- Anthropic CEO 力挺「宁坐牢也要造超级智能」的激进表态 — robleclerc · 2026-09-25
- 斯坦福打造 3.7 万 AI 智能体「虚拟生物科技公司」,分析 5.7 万项临床试验 — james_y_zou · 2026-09-25
- louisvarge:2026 年健康富足的人生是极端特权 — louisvarge · 2026-09-25
- Helen Toner 谈 OpenAI 安全事件霸版澳媒:5-7 月出问题,12 月才会知道现在的隐患? — lxrjl · 2026-09-25
- 我们造出的新心智生来就懂人类的一切恐惧与恶意 — ZeroStateReflex · 2026-09-25