HarnessTax 研究追问:编码 Agent 的框架到底值多少分
matt_d · hn · 2026-09-17
HN 上讨论的 HarnessTax 项目(harnesstax.github.io)系统研究「框架(harness)对编码智能体表现的影响有多大」:同一模型配不同的 agent 脚手架/工具编排,成绩差异可能相当可观。项目主页提供了对 harness 层(提示词、工具接口、上下文管理等)的量化对比,是理解编码 agent eval 中「模型能力 vs 脚手架工程」归因问题的一个参考。
「编程与Agent」频道最新
- LangGraph 用 Jev 做廉价分类器,为 Agent 流程引入更多控制原语 — hwchase17 · 2026-09-18
- Claude Code 2.1.276 更新明细:距上版不到 6 小时,提示词增 440 token — ClaudeCodeLog · 2026-09-18
- Claude Code 2.1.276 发布:修复代理网关下全部请求 400 的回归 — ClaudeCodeLog · 2026-09-18
- Claude Code 2.1.276 发布:修复代理网关下全部请求 400 的回归 — ClaudeCodeLog · 2026-09-18
- Layers 跑通首个自主闭环:Detail 提修 PR,Devin 审查,Claude 终审 — saranormous · 2026-09-18
- 用 Gradio 把 4B 小模型微调成答案打分器,温度缩放校准置信度 — Gradio · 2026-09-18