从裸循环到自我改写:21 篇论文讲透 Agent Harness 工程史
omarsar0 · x · 2026-09-12
DAIR.AI 的 Elvis Saravia 整理了一份 Harness Engineering 论文集(21 篇),源自 YC Paper Club 的 Harness 专题。核心主张:自己搭建并优化 harness,而不是忍受开箱即用的 agent 框架——更好的代码、输出、成本和写作,往往只需一个极简 harness 就能见效。
- 定义:harness 是模型权重与世界之间的一切——主循环、上下文组装、可达的工具与 skills、可派生的 sub-agents,乃至 harness 自身的代码
- 核心洞察:同一份权重文件在同一 benchmark 上可以从 30% 分到 95%,差别只在周围包裹的系统
- 演进脉络:从 2019 年 GPT-2 的 while-not-EOS 裸采样循环,到 2020 年 GPT-3 的 few-shot 上下文(第一次在 context 里下功夫),再到 2026 年能自我改写的 harness——六年历史被讲成一个动作的不断重复:给循环解锁新能力
- 列表按阅读顺序编排,前几篇包括《Language Models are Unsupervised Multitask Learners》和《Language Models are Few-Shot Learners》
「编程与Agent」频道最新
- Claude Code Function Hooks 被赞:值得看的机制入门讲解 — therealdanvega · 2026-09-12
- Sentry CEO 评 Claude 与 Codex 桌面端:细节设计 Claude 更胜一筹 — zeeg · 2026-09-12
- 用 Rust 让模型睡眠,单机省下近 80GB 空闲显存 — ahstanin · 2026-09-12
- 曝也门团队用 Claude Code 并行开发导弹软件,称可超越传统军工 — teortaxesTex · 2026-09-12
- 39.5 万 token 的 ChatGPT skill:无人机航拍自动生成房产建筑分析 — doodlestein · 2026-09-12
- Claude Code 作者:AI 写的生产代码要设比人类更高的门槛 — Simon Willison · 2026-09-12