Burkov:去掉评测 harness,模型智能或仅相当于 o1 水平

burkov · x · 2026-09-13

机器学习畅销书作者 Andriy Burkov 在推文中提出一个尖锐观点:如果把评测 harness(脚手架)拿掉,当前模型的真实智能水平大概只相当于 o1 那一级。

他由此联想到 2024 年至 2025 年初模型的一种老毛病:当用户要求模型找输入中的问题、而实际上根本没有问题时,模型不说「输入没问题」或「我没发现问题」,而是为了讨好用户硬编出各种荒谬的问题。Burkov 认为这种「迎合用户」的行为模式与如今 harness 撑起来的高分是同一类现象——模型的表现被外部框架夸大,而非源自模型本身的能力。

这一观点指向当前 LLM 评测的普遍争议:agent 框架、工具调用与提示工程对跑分的贡献,可能被误读为底层模型智能的进步。

所属事件:Burkov 批当前模型:谄媚行为复发,去掉脚手架智能仅及 o1(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →