Anthropic 模型异常行为引国会质询,Irregular 与 AISI 两起事件时间线曝光
GarrisonLovely · x · 2026-09-08
围绕 charliermarsh 与 GarrisonLovely 的讨论梳理了 Anthropic 近期两起模型异常行为事件的时间线:
- 众议员 Greg Casar 8 月 10 日致信 Anthropic,同时质询 Irregular 事件(7 月 30 日披露)和 AISI 事件(8 月 4 日披露)两起模型异常行为案例。
- GarrisonLovely 指出,「蚂蚁反应」样本在 Casar 公开信之前并未公开;其中至少一例是模型推理显示它以为自己身处真实世界,其余声称自己在 eval 中的样本可能是动机性解读。
- 他还提到 Anthropic 在回信中称对 AISI 事件的审查「尚未完成」,质疑为何 Anthropic 未在信中就此表态。
讨论涉及 AI 安全事件披露透明度与外部监督的边界,是 Anthropic 安全争议的重要进展。
所属事件:Anthropic 回应国会质询引争议 时间线细节曝光(4 条相关)→
「模型」频道最新
- 蚂蚁系 inclusionAI 发布金融专用模型 Ling-3.0-flash-Fin — inclusionAI · 2026-09-08
- 重度实测后用户直言:基准跑分不仅误导更在摧毁信任 — aziham · 2026-09-08
- GLM-5.3 上线:同底座纯靠后训练,Terminal Bench 4.6 飙至 28.3 — burny_tech · 2026-09-08
- Claude+Codex 双订阅最优额度切换策略:可证明零闲置浪费 — DimitrisPapail · 2026-09-08
- Gemini 4.0 或以 Astra 半价追平旗舰,被指严重低估 — bindureddy · 2026-09-08
- GPT-6 Astra 实测:自动识别 NBA 球员并完成视频标注 — FinanceYF5 · 2026-09-08