edith-1 专抓 agent 失败与 reward hacking,准确率超 Sonnet-5.5 成本仅 1/274

xennygrimmato_ · x · 2026-10-09

teknopawn 发布 edith-1,一个用于在线轨迹监控的决策模型,训练目标是捕捉 agent 失败、reward hacking,以及任务、评分器(grader)和环境本身的问题。在其自建评测上,edith-1 在平衡准确率上超过 Claude Code 中的 Sonnet-5.5,而估算成本仅为其 1/274。补充细节(引用推文):edith-1 被用作在线轨迹监控的概率过滤器,被标记的运行再交给更慢、更贵的 agent judge 做基于证据的失败分析,覆盖任务、轨迹、验证器与执行环境。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →