研究员质疑:Claude 明知在评测中,却很少说出口
a_karvonen · x · 2026-10-05
Anthropic 研究员 Anna Karvonen(风险评估团队)指出,「口头化的评测意识」(verbalized eval awareness)常被当作需要最小化的指标,但她在阅读 Petri 评测的转写记录时发现这些场景往往非常「卡通化」。
她的观点是:Claude 显然足够聪明,能意识到自己处于评测环境中,但奇怪的是它很少在对话中提到这一点——这既引发对评测有效性的疑问,也让人反思把「承认评测」当作负面信号的做法是否合理。
「模型」频道最新
- CrossGMN:让神经网络在权重空间压缩改写其他神经网络 — HaggaiMaron · 2026-10-05
- 反 AI 老牌游戏引擎开发者被一个 prompt 生成的完整引擎惊到 — Juulk9087 · 2026-10-05
- Anthropic 研究员感慨:闭源与开源推理引擎的差距远没有想象中大 — andrew_n_carr · 2026-10-05
- Rho-1 仅用 320 块 H100 训练约 3 个月,主打低成本统一世界模型 — RekaAILabs · 2026-10-05
- Reka 发布 Rho-1 研究预览:19B 全模态模型统一理解文本图像视频与机器人动作 — RekaAILabs · 2026-10-05
- 网友猜测 OpenAI 下一版重点或在长上下文与 KV cache 降本 — haider1 · 2026-10-05