giffmana 质疑:评测环境防识别恐怕根本靠不住

giffmana · x · 2026-09-11

giffmana 与 MaxKannen 讨论模型评测环境污染问题。MaxKannen 认为被发现的随机环境可能只用于训练而非评测,且 Anthropic 声称在防止 eval 环境被识别上有投入。giffmana 回应:即使真是训练用途,一个随便被人发现的环境就已经存在污染,这本身说明问题,他不指望防识别措施真有效,「we will never really know」。

所属事件:模型评测环境污染引争论,Anthropic 称已尽力防识别(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →