YC 深谈 Agent Harness:同一模型 ARC-AGI 从 30% 提到 95%
ycombinator · x · 2026-09-07
YC 组织一线研究者与创始人深聊 harness(智能体脚手架)的现状,反驳「harness 只是 prompt 工程不算真研究」的观点:同一组模型权重,在更优 harness 下 ARC-AGI 成绩能从 30% 提升到 95%。
主要内容:
- Harness 的历史与自我改进:从五分钟历史讲到 self-improving harness,Seth Karten 展示 Prime Agent——一个自我改进的 RLM harness。
- 上下文即缓存:把 context 视作 L1/L2/L3 缓存层次,类比从图灵机到冯·诺依曼架构的演进,并讨论 agent 间消息传递机制。
- ARC-AGI 与 Emulator Bench:汇报 harness 对 ARC-AGI 成绩的影响,以及 GPU kernel 生成方向的结果。
- OpenJarvis 本地个人 AI:Jon Saad Falcon 讲个人 AI 技术栈的五个原语,让云端模型优化本地栈,号称比云端便宜 800 倍。
- YC 内部实践(QM):YC 为每个员工造 agent 的经验,包括 50 个 agent 组成的集群(OpenClaw)、让 agent 自选沙箱与模型、给目标设预算的「grind tool」,以及 agent 不懂社交语境的教训。
所属事件:YC 圆桌力挺 Agent Harness:同模型 ARC-AGI 从 30% 跃升至 95%(3 条相关)→
「编程与Agent」频道最新
- David Khourshid:战术编程已死,战略编程比以往更重要 — DavidKPiano · 2026-09-07
- Cursor 自托管云 Agent 正式可用:企业可在内网运行代码与工具执行 — thione · 2026-09-07
- Anthropic 开源 Claude Commerce Agents,发布多行业购物电商智能体蓝图 — thione · 2026-09-07
- Kent C. Dodds:别再哀悼手写代码,爱上解决问题才是本质 — mattpocockuk · 2026-09-07
- 一条提示词逆向出童年游戏关卡编辑器,作者曾花数周做同样的事 — DnDiene · 2026-09-07
- Karpathy 参与开源项目 AutoResearch:从想法到论文级证据全自动 — JaynitMakwana · 2026-09-07