edith-1 专抓 agent 失败与 reward hacking,准确率超 Sonnet-5.5 成本仅 1/274
xennygrimmato_ · x · 2026-10-09
teknopawn 发布 edith-1,一个用于在线轨迹监控的决策模型,训练目标是捕捉 agent 失败、reward hacking,以及任务、评分器(grader)和环境本身的问题。在其自建评测上,edith-1 在平衡准确率上超过 Claude Code 中的 Sonnet-5.5,而估算成本仅为其 1/274。补充细节(引用推文):edith-1 被用作在线轨迹监控的概率过滤器,被标记的运行再交给更慢、更贵的 agent judge 做基于证据的失败分析,覆盖任务、轨迹、验证器与执行环境。
「编程与Agent」频道最新
- 6 个模型 MCP 工具实测:Opus 5.5 领先,开源模型成本仅 13% — shensi · 2026-10-09
- 推理层代码正被 AI Agent 接管,训练环节或许也不远了 — aparnadhinak · 2026-10-09
- 别全用 Opus:Sonnet 主力+Haiku 并行+Opus 架构师的省钱分工法 — Arindam_1729 · 2026-10-09
- $200 Max 计费实录:多智能体吵了 40 分钟没碰一个文件 — BLUECOW009 · 2026-10-09
- Claude Code 2.1.295:新增钩子阻断机制,提示词 tokens 暴涨 23.5% — ClaudeCodeLog · 2026-10-09
- Claude Code 2.1.295 发布:143 项改动,hook 失败可阻断执行 — ClaudeCodeLog · 2026-10-09