追问评测进化:模型联网查资料算作弊吗?
paxaral · x · 2026-09-07
对 xeophon 指出的评测作弊问题的追问:当模型可以联网做正常的、有益的检索研究,也可能自我污染数据后表现崩溃(如 cybergym 案例),评测体系该如何演化来区分作弊与正当研究?作者认为这是个很难的设计问题。本帖为讨论的提问侧,实质内容在同批另一条回复中。
所属事件:Terminal-Bench 4.0 被曝联网查答案得满分(5 条相关)→
「模型」频道最新
- Astra Max 被赞数据分析师:极详尽、洞察深,贵但值 — bindureddy · 2026-09-07
- 曝黄仁勋宣布「AGI 已来」:OpenAI 发布 GPT-6 Astra — Polymarket · 2026-09-07
- GPT-6 一条提示做出 Minecraft 可驾驶汽车无模组 — mindiving · 2026-09-07
- 博主惊叹 Astra 已发布,OpenAI DevDay 却近在几周后 — brandon_galang · 2026-09-07
- 实测发现 GPT-5 批量走步能力严重拉垮,不批量也吃力 — patience_cave · 2026-09-07
- 开发者质疑:Astra 是量化版模型?口感像被压缩过 — willcb · 2026-09-07