弱模型更能暴露 harness 缺陷,前沿模型反而会绕过去
arsenyinfo · reddit · 2026-07-27
一位从业者认为,拿更弱的模型来调试,往往比只测前沿模型更能发现问题。
- 顶级模型常常能“硬闯”过去:即使工具调用格式错了、错误信息怪异、甚至工具缺失,它们也能继续把任务做完。
- 也正因为太强,这些模型会把底层 harness 和周边基础设施的 bug 掩盖掉。
- 作者把同一套测试跑到更便宜的模型上后,反而一下暴露出十几个 Opus 已经自动绕过去的问题。
「编程与Agent」频道最新
- 开源多代理 SDLC 工具在定位任务上比 Claude Code 便宜 75% — NeighborhoodOwn8510 · 2026-07-27
- PrimeTask 内置本地 MCP,让 ChatGPT 和 Claude 直接管工作流 — XVX109 · 2026-07-27
- Hermes 高阶用法靠记忆、技能和定时任务 — tomcrawshaw01 · 2026-07-27
- 一个字体设计 skill 已被做成并开源 — JeremyNguyenPhD · 2026-07-27
- LLM Skills 可能提效,也可能引入新技术债 — srchvrs · 2026-07-27
- Annotate 让 AI agent 通过 MCP 在屏幕上画标注 — adamm_carter · 2026-07-27