Redwood Research:前沿大模型对齐评估的可靠性远低于宣称

dl_weekly · x · 2026-08-08

Redwood Research 发布分析文章指出,当前前沿 AI 实验室(如 Anthropic)在系统卡片中声称的“对齐评估”结果,并不能有力证明模型不存在错位风险。

文章核心观点包括:

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →