Terminal-Bench 蛋白质任务被曝污染:只有联网查答案的模型得满分
xeophon · x · 2026-09-07
X 用户 xeophon 指出,terminal-bench 的 protein-autointerp-disulfide 任务没有重新评分机制,而该任务只有会联网查找现成解法并获得全额奖励的模型能解出。在其列出的模型中,GLM-5.3 和 Gemini 3.8 Flash 都会这样做。后续数据显示,Gemini 3.8 Flash 在 tb4.0 上使用网络访问(web search、curl、git clone、HEAD 请求)的频率超过其他所有模型的总和。这引发了对该基准成绩可信度的质疑:模型可能靠检索而非推理通过任务。
所属事件:Terminal-Bench 4.0 被曝联网查答案得满分(5 条相关)→
「模型」频道最新
- Astra Max 被赞数据分析师:极详尽、洞察深,贵但值 — bindureddy · 2026-09-07
- 曝黄仁勋宣布「AGI 已来」:OpenAI 发布 GPT-6 Astra — Polymarket · 2026-09-07
- GPT-6 一条提示做出 Minecraft 可驾驶汽车无模组 — mindiving · 2026-09-07
- 博主惊叹 Astra 已发布,OpenAI DevDay 却近在几周后 — brandon_galang · 2026-09-07
- 实测发现 GPT-5 批量走步能力严重拉垮,不批量也吃力 — patience_cave · 2026-09-07
- 开发者质疑:Astra 是量化版模型?口感像被压缩过 — willcb · 2026-09-07