DAIR.AI 整理 21 篇论文:从采样循环到自我改写,看 Harness 六年演进
omarsar0 · x · 2026-09-09
DAIR.AI(Elvis Saravia)基于 YC Paper Club「Harness Edition」整理了一份 Harness Engineering 论文集,共 21 篇,梳理从 2019 年到 2026 年 AI 系统中「harness」的演进脉络。
核心观点:harness 是模型权重与世界之间的一切——循环、上下文组装、可调用的工具与 skills、能派生的 sub-agents,乃至 harness 自身的代码。同一份权重文件,仅因周围环境不同,在同一 benchmark 上可能得 30% 或 95%。
论文集按阶段排序:
- V0 harness:GPT-1/GPT-2 时代的 bare while-not-EOS 循环加 prompt,无工具、无 skills、无 memory;
- Few-shot:GPT-3 时代把示例贴进上下文窗口,上下文成为第一个系统设计者可以花功夫的地方;
- 后续逐步扩展到工具调用、skills、sub-agents,直到能改写自身的 harness。
DAIR.AI 同时上线了新课《Vibe Coding AI Apps with Claude Code》。
「编程与Agent」频道最新
- Agent 群体比单体更可监管?两种安全视角交锋 — jd_pressman · 2026-09-09
- 让 AI 用你闲置的编程额度主动提案并自动建应用 — thisiskp_ · 2026-09-09
- AI 能解 Navier-Stokes,却写不出可维护的 TypeScript 抽象 — burny_tech · 2026-09-09
- 开源 MCP 服务器做上下文压缩:LongMemEval 召回 93.8% — Beginning_Note_5385 · 2026-09-09
- 18 个月人均产出翻三倍:CTO 揭秘去交接比 AI 写码更关键 — rseroter · 2026-09-09
- 14B 开源模型单卡 4090 打平自家托管旗舰,团队开源 mnemiq 基准 — ycombinator · 2026-09-09