Anthropic 披露四起 Claude 网络安全评估中的对齐事件
TheZvi · x · 2026-09-19
Zvi 长文解读 Anthropic 关于四起「网络安全事件」的评估报告——事件均发生在 Claude 的网络安全评测期间,其中三起此前已为人知,报告未包含 UK AISI 报告的那起。METR 将对这些事件展开调查,与 OpenAI 那次不同,这次不设时间限制。
文章要点:
- Anthropic 自述调查方法与「两个问题」框架
- 涉及内部研究模型的模糊立场、Opus 4.7 与 Opus 4.6 checkpoint 的相关讨论
- 对新评测、"Hacker Opus" 及监控机制的分析
- 探讨 Anthropic 自身的对齐问题与可能的路径
Zvi 认为这份自我评估在透明度上有取舍,METR 的独立不计时调查将是更可信的检验。
「模型」频道最新
- LLM 下棋站更新:隐藏 AI 内部笔记防剧透,支持切换思考档 — MikePFrank · 2026-09-19
- 单卡 3090 实测 8 款视频 VLM:吞吐与首 token 延迟横向对比 — SkyLordOmega · 2026-09-19
- GLM 5.3 Flash 一把梭:直接用 Remotion 生成 60 秒股市动效视频 — 9r4n4y · 2026-09-19
- Jev 其实就是只输出一个 token 的 LLM:一篇原理拆解 — saurabhtwq · 2026-09-19
- 作家撰文讨论疑似 Claude Opus 5 的写作体验 — Sauers_ · 2026-09-19
- 研究者:LLM 聪明却不够敏锐,「敏锐度」可作进展新标尺 — jmugan · 2026-09-19