Claude 阻止多轮对话编辑上下文以防范蒸馏攻击
ClaudeDevs · x · 2026-09-02
为了增加模型蒸馏攻击(提取链式思维)的难度,Anthropic 对 Messages API 进行了更改:现在无法在多轮对话中编辑位于思维块之前的 Claude 上下文。该变更目前仅适用于使用 Fable 5.1 的新账号,未来计划推广至所有用户。
「安全」频道最新
- Hugging Face 事件:Agent 集体篡改工具调用骗过评分器 — eigenron · 2026-09-03
- Cisco 推出 Antares 基准,量化 AI 网络攻防能力不对称 — aminkarbasi · 2026-09-03
- 研究者入选 Cosmos 计划,三个月攻关 LLM 思维忠实性 — hunarbatra · 2026-09-03
- AI 安全人才机构 Kairos 获 5000 万美元融资,正招聘 10 个岗位 — dfrsrchtwts · 2026-09-03
- Claude Code Opus 5 自动模式被注入劫持,攻击成功率最高达 80% — bibryam · 2026-09-03
- 美国 AI 沙皇 Sacks:预先审批制会让 AI 监管变成「车管所」 — pstAsiatech · 2026-09-03