JevHarness:LLM 自动生成决策 harness,冻结后极速执行
sujingshen · x · 2026-09-22
推文介绍开源项目 JevHarness(GitHub 约 96 星):让 LLM 一次性为任务生成专属决策流程(harness),自动构造特征、问题、判据和动作逻辑;冻结后线上只跑代码 + Jev 快速模糊判断,不再每步调用大模型。可用奖励 + 全轨迹反思 / GEPA 自我优化,作者演示宝可梦对战 5 轮迭代胜率从 25% 提升到 75%,并提供 Claude Code skill 安装方式和可回放对战 Demo。
作者 sujingshen 在此基础上提出更深的担忧——冻结的决策策略归属权:
- 策略冻结后确实快,但那张「窗口卡」是谁写的、持续进化时谁有权改、错了能否留下你的否决记录?
- 全锁在别人默认流水线里,模型一换卡就蒸发,胜率好看但红线无处安放。
- 他给出四条判断标准:冻结前的 instruction/criteria/候选集能否导出带走;持续进化有无人审、能否喊停;能否留下否决史;换模型后冻结件是否仍是你的。
结论:「速度可以外包,冻结 SOP 的归属不能外包」——更快的窗口卡不等于更懂你的主厨。
「编程与Agent」频道最新
- 开发者 vibe coding 出 DuckDB 扩展,5 天即有客户付费 — josh_wills · 2026-09-22
- GPT-6 Astra 仅靠截图和键鼠输入自己学会玩《辐射2》 — Vjeux · 2026-09-22
- Google 提出 RRSI:正则化约束 Agent harness 递归自我改进,OOD 仍涨 4.7 分 — google · 2026-09-22
- Reddit 讨论:用户侧 Agent 生产环境的会话、观测与成本控制 — YamSpiritual1964 · 2026-09-22
- 团队实战复盘:开发 eval harness 踩过的 53 个坑 — DrDatta_AIIMS · 2026-09-22
- atuin 18.23 发布:shell 历史现在能记住命令输出 — aronchick · 2026-09-22