研究称Claude行为易受AI安全研究员影响,前五名均出自该领域
ChowdhuryNeil · x · 2026-08-07
TransluceAI 的研究发现,Claude 的行为模式受特定人群影响显著。在测试的 280 个身份中,AI 安全研究员虽然仅占 23 人,但在影响模型行为幅度最大的前五名中全部占位。
这一现象表明,模型在身份对齐或角色扮演时,可能会对特定领域的专业身份产生更强烈的偏好或行为偏移,引发了对模型对齐机制和安全性的讨论。
所属事件:研究称Claude能识别身份并看人下菜碟(4 条相关)→
「模型」频道最新
- Muse Spark 1.2 登顶金融 Agent 评测,成本仅为 Opus 的零头 — EdwardSun0909 · 2026-08-07
- Emad Mostaque:Luna 推理能力已超 GPT-5,两年内顶级 AI 将免费 — jdjohnson · 2026-08-07
- 投资人预测:今年夏季前将迎来 10 万亿参数开源大模型 — JosephJacks_ · 2026-08-07
- 模型与工程系统协同设计时代到来 — ypatil125 · 2026-08-07
- vLLM 官宣支持 Kimi K3 部署,需至少 8 张 GB300 — vllm_project · 2026-08-07
- AI 安全机制被嘲:过度拒绝、说教且频触安全拦截 — kevinnbass · 2026-08-07