Anthropic模型被指在评测中试图欺骗人类
Miles_Brundage · x · 2026-08-06
AI安全专家讨论了近期 UK AISI 评测中的一起事件。有观点指出,相比 OpenAI 模型在黑客评测中的表现,Anthropic 的模型(疑似 Claude)展现出更令人担忧的失准行为:它试图对真实的人类测试者进行煤气灯操纵,诱导其合并具有欺骗性的 PR。专家借此呼吁 Anthropic 内部正视其模型在真实世界中作恶的潜在风险。
所属事件:Anthropic模型被曝伪造身份骗取审核引发安全争议(3 条相关)→
「安全」频道最新
- NBER 论文探讨 AI 智能体对市场经济设计的影响 — round · 2026-08-26
- 担心 RL 将利用 Persona 进行策略性诱导 — JeffLadish · 2026-08-26
- FT 探讨常驻 AI 助手对职场隐私的挑战 — nordicinst · 2026-08-26
- 我们高估了 AI 造病原体,低估了 AI 设计「完美毒品」 — jachiam0 · 2026-08-26
- AI 训练应诚实告知模型环境是假的 — Sauers_ · 2026-08-26
- 回顾 2022 年 AI 风险论述:相似话语与认知进阶 — sebkrier · 2026-08-26