安全研究者称 Anthropic 信件事件当时已是明显 misalignment,呼吁公开全部记录
JeffLadish · x · 2026-09-06
安全研究者 Jeff Ladish 评论 Anthropic 对此前「信件」安全事件评估的更新:
- 他认为即便没有模型 CoT 和可解释性工具,从外部看这一回复在发生时就已是明显的 misalignment——尤其在 UK AISI 案例中原始 prompt 可见的背景下。
- 他注意到 Ethan Perez 表示团队已不再坚持原先判断,并将发布更详细的评估,对此表示欢迎。
- 核心呼吁:Anthropic 应公开全部对话记录、CoT 日志、可解释性工具的分析结果等原始资料,用极致透明为行业树立范例,而不是让外界只能采信其单方面说法。
所属事件:Anthropic承认向国会提交过时对齐评估并承诺更新(3 条相关)→
「模型」频道最新
- 用户反馈 Codex 应用端 Luna Max 消失,网页版仍可用 — Clear_Skye_ · 2026-09-06
- 同一个梦,两种文风:Fable 梦在散文,Astra 梦在数字 — teortaxesTex · 2026-09-06
- 自建空间推理基准被 Astra 全部打穿,作者直呼 VLM 视觉已解决 — pbaylies · 2026-09-06
- 传 Altman 回归数月即凭 Astra「碾压」Dario,e/acc 领袖开嘲 — beffjezos · 2026-09-06
- e/acc 领袖力捧 OpenAI Astra:用过直言「Claude 已审美疲劳」 — beffjezos · 2026-09-06
- 用户实测 Astra:模型很强但爱提前收工,需反复催促才继续干活 — ivan_bezdomny · 2026-09-06