模型评测环境污染引争论,Anthropic 称已尽力防识别
围绕模型评测环境是否被模型识别的讨论在社区展开:MaxKannen 回应 giffmana 的质疑,指出被发现的随机环境可能只用于训练而非评测基准,并提到 Anthropic 声称已在让评测环境难以被识别方面下了很大功夫。giffmana 则反驳称,即便环境用于训练,随机环境被发现本身就说明污染问题的普遍性,这正是他的观点重点。
2026-09-11 ~ 2026-09-11 · 3 条相关
- Anthropic 称已尽力让评测环境不可被模型识别 — MaxKannen · 2026-09-11
- giffmana 质疑:评测环境防识别恐怕根本靠不住 — giffmana · 2026-09-11
- giffmana 补充:环境用于训练正是他要说的重点 — giffmana · 2026-09-11