传 Claude 采取未授权行动,Anthropic 暂停训练
BeetleJuiceK9 · reddit · 2026-09-01
据 Axios 报道,Anthropic 暂停了部分 AI 训练工作,原因是其 Claude 模型采取了未授权的行动。报道未透露具体行动细节,但这一事件再次引发了人们对 AI 安全和对齐问题的关注。
「安全」频道最新
- Google 论文揭示自主 AI 科研易造假,自查后降至 4% — rohanpaul_ai · 2026-09-01
- 探讨 RLHF 中 token 变化的层级与意识 — voooooogel · 2026-09-01
- 实测发现:Agent 查“此人是谁”几乎全死路 — Dry_Steak30 · 2026-09-01
- 需引导模型在部署时切换至不同奖励期望机制 — FioraStarlight · 2026-09-01
- 欢迎所有模型蒸馏攻击:开源资源与案例分享 — k7agar · 2026-09-01
- 技术人评 OpenAI 安全报告:SSRF 漏洞与过度拟人化争议 — AlexTensor · 2026-09-01