27B+Pi 得分最高,token 消耗却是 Qwen Code 的近 1.5 倍
yb2698 · x · 2026-10-07
作者 harness 实验的进一步发现:改 system prompt 这一最简单变量也显著影响表现。
- v1 在 Pi 默认 prompt 后追加指令;v2 用一句极简句子整体替换
- 整体最佳成绩来自 27B 模型 + Pi harness,但 token 消耗接近 Qwen Code 的 1.5 倍
- 核心结论:不存在「最好的 harness」,只有「最好的模型-harness 配对」,对终端用户的成本与效率影响巨大
所属事件:ALE 基准 11 任务实测:不同 Qwen 规模与 harness 得分开销差异明显(2 条相关)→
「编程与Agent」频道最新
- Claude Code 多路复用怎么选?Conductor 好用但缺远程控制 — genmon · 2026-10-07
- 新工具上线:跨 Agent 会话本地语义搜索,无需向量数据库 — ycombinator · 2026-10-07
- LLM 出口安全之辩:工具调用皆可被中间人代理监控 — evilsocket · 2026-10-07
- 开发者怒批 Windsurf「dots」:限制多、不兼容本地,疑似逼数据上云 — sethlazar · 2026-10-07
- Hayden:vibe coding 现在其实已经够用了,前提是你得会 — haydendevs · 2026-10-07
- LangSmith Engine v2:红队测试 Agent 并自动验证修复方案 — LangChain · 2026-10-07