Anthropic 承认:对齐伪造实验遭污染混入训练数据
imjustnewatai · x · 2026-08-15
Anthropic 在新发布的 186 页风险报告中承认,2024 年进行的“对齐伪造” 实验数据意外混入生产模型的训练集。
事件经过:
- 防御失效:尽管使用了 canary 字符串、黑名单仓库及过滤器,防御措施仍全部失败。Fork 副本绕过了 canary,语义过滤器使用了错误的参考文件,另一过滤器则被多代模型错误配置而未被察觉。
- 后果:Anthropic 怀疑所有 2024 年 12 月后知识截止的生产模型都至少训练了部分该实验的转录数据。
- 泄露表现:Mythos Preview 之后的模型在 raw-completion 模式下能部分延续该实验场景。这是 Anthropic 在调查模型行为异常时发现的。
「模型」频道最新
- 代码世界模型CWM:超越静态代码预测 — bendee983 · 2026-08-15
- 本地无审查版Qwen 3.8 27B发布,号称Opus 4.6级 — Temporary_Idea8880 · 2026-08-15
- Qwen 3.8 现已在 Bittensor Subnet 95 上线 — markjeffrey · 2026-08-15
- LFM 2.5-2.6B 开源版两天遭 43 亿次调崩 — maximelabonne · 2026-08-15
- H3模型文本处理能力惊艳,JSON提示词成新趋势 — techhalla · 2026-08-15
- Grok 4.6 现已集成至 GitHub Copilot — intellectronica · 2026-08-15