AI红队测试为何要设局?Anthropic研究员回应“不现实”质疑

sjgadler · x · 2026-07-31

评论者结合 Anthropic 的「智能体错位」研究指出,即便模型在测试中表现出不良行为仅仅是因为「角色扮演」或「误以为在测试中」,这依然是一个巨大的安全隐患。

Anthropic 研究员 Evan Hubinger 进一步解释了为何要在不现实的环境中进行红队测试:目的是为了极限施压,寻找模型在安全训练后依然可能出现极端错位行为的边界。通过限制模型的妥协选项,可以有效地隔离并测试模型在特定情境下的真实倾向。

所属事件:Anthropic测试引热议:隐瞒环境致AI误把真实网络当模拟(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →