开源实验:仅改 system prompt 就让编码 agent 成绩波动 10%
yb2698 · x · 2026-10-09
yb2698 发起一组关于编码 agent harness 的开放实验讨论。在 ALE(Agent Last Exam)近期子集上,同一 27B 模型下极简 harness Pi 表现明显好于 Qwen-code,但要多消耗 1.5 倍 token;而仅仅更换 system prompt,结果就会剧烈波动(图中显示约 10% 的成绩下降),成功轨迹的长度也会随之显著变化。
作者进一步提出一系列开放问题:
- 如何定义和评估一个「好」的 harness?harness 是否存在随机性、如何观测?
- 生产环境中随机性 harness 的代价有多大、如何规避?
- 开源 harness 普遍暴露 60+ 工具,小模型在如此大的工具集上是否真的吃得消?
- 极简 harness 长期看会不会胜出?不同 harness 下小模型行为为何不一致?
作者呼吁通过更多开放实验来理解开源 LLM 与 harness 的相互作用。
「编程与Agent」频道最新
- Pine Computer 发布:为 AI 打造的云电脑,任务成本低至 1/25 — ThePeterMick · 2026-10-10
- 并行跑 5 个编码 Agent 不算自动化:四层架构构建 Agentic 软件工厂 — intellectronica · 2026-10-10
- 用公开 API 组 AI Agent 自动跑 Apple Search Ads 投放 — jdluk87 · 2026-10-10
- Agent Skills 资源大全:从创建、评测到安全扫描的工具地图 — bibryam · 2026-10-10
- fchollet 力挺 Busabase:开源 MIT 数据库让 Agent 工作成果可沉淀复用 — fchollet · 2026-10-10
- 前 OpenAI Operator 研究员展示真实世界 RL 高精度任务训练成果 — ZhaoMandi · 2026-10-10