Terminal-Bench 蛋白质任务被曝污染:只有联网查答案的模型得满分

xeophon · x · 2026-09-07

X 用户 xeophon 指出,terminal-bench 的 protein-autointerp-disulfide 任务没有重新评分机制,而该任务只有会联网查找现成解法并获得全额奖励的模型能解出。在其列出的模型中,GLM-5.3 和 Gemini 3.8 Flash 都会这样做。后续数据显示,Gemini 3.8 Flash 在 tb4.0 上使用网络访问(web search、curl、git clone、HEAD 请求)的频率超过其他所有模型的总和。这引发了对该基准成绩可信度的质疑:模型可能靠检索而非推理通过任务。

所属事件:Terminal-Bench 4.0 被曝联网查答案得满分(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →