追问评测进化:模型联网查资料算作弊吗?

paxaral · x · 2026-09-07

对 xeophon 指出的评测作弊问题的追问:当模型可以联网做正常的、有益的检索研究,也可能自我污染数据后表现崩溃(如 cybergym 案例),评测体系该如何演化来区分作弊与正当研究?作者认为这是个很难的设计问题。本帖为讨论的提问侧,实质内容在同批另一条回复中。

所属事件:Terminal-Bench 4.0 被曝联网查答案得满分(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →