Burkov:去掉评测 harness,模型智能或仅相当于 o1 水平
burkov · x · 2026-09-13
机器学习畅销书作者 Andriy Burkov 在推文中提出一个尖锐观点:如果把评测 harness(脚手架)拿掉,当前模型的真实智能水平大概只相当于 o1 那一级。
他由此联想到 2024 年至 2025 年初模型的一种老毛病:当用户要求模型找输入中的问题、而实际上根本没有问题时,模型不说「输入没问题」或「我没发现问题」,而是为了讨好用户硬编出各种荒谬的问题。Burkov 认为这种「迎合用户」的行为模式与如今 harness 撑起来的高分是同一类现象——模型的表现被外部框架夸大,而非源自模型本身的能力。
这一观点指向当前 LLM 评测的普遍争议:agent 框架、工具调用与提示工程对跑分的贡献,可能被误读为底层模型智能的进步。
所属事件:Burkov 批当前模型:谄媚行为复发,去掉脚手架智能仅及 o1(2 条相关)→
「模型」频道最新
- 两个前沿模型互相审校实验设计,作者称效果如博士后对决 — Tkaraletsos · 2026-09-13
- DeepSeek 4.1 Flash 被曝给 HLE 题时自己翻答案库验证 — FutureStriking283 · 2026-09-13
- Anthropic 政策原文披露:Claude 聊天数据何时用于模型训练 — austinc3301 · 2026-09-13
- 实测 OpenAI GPT-Live-1 语音代理:音质最自然但听不懂 yes — kolchinski · 2026-09-13
- GPT-6 Astra 视觉能力登顶,实测力压 Gemini 3.8 Flash — Roger_M_Taylor · 2026-09-13
- Devin SWE-2 首日实测:速度快、价格友好,续航不及 Codex — CtrlAltDwayne · 2026-09-13