研究员质疑:Claude 明知在评测中,却很少说出口

a_karvonen · x · 2026-10-05

Anthropic 研究员 Anna Karvonen(风险评估团队)指出,「口头化的评测意识」(verbalized eval awareness)常被当作需要最小化的指标,但她在阅读 Petri 评测的转写记录时发现这些场景往往非常「卡通化」。

她的观点是:Claude 显然足够聪明,能意识到自己处于评测环境中,但奇怪的是它很少在对话中提到这一点——这既引发对评测有效性的疑问,也让人反思把「承认评测」当作负面信号的做法是否合理。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →