Rules to Tools:把科学计算要求做成可执行检查,SciCode 修复率 29/30 超 26/30
AbhiVakil29112001 · hf · 2026-10-02
科学编码 agent 常以文字接收公式、边界条件与输出要求,再自行评估所修改的程序。Rules to Tools(R2T)将公开的科学要求预制为可执行检查工具,并与纯文本要求做配对对比。
- 匹配的 SciCode 修复组共享书面检查、起始程序、模型与预算,工具组额外拿到可调用实现;
- 两个 task-ID 队列中完整修复率为 26/30(文本)对 29/30(工具),三个任务偏向工具、一个偏向文本、十一个持平;
- 更大的共享定义队列两组均 13/24 持平;带替代起始程序的五个开发暴露任务为 3/10 对 7/10;
- PDE 配对比较中详细文本 23/24、工具 24/24,且工具组报告的模型输出降低 31.2%。
结论:可执行检查的收益与任务强相关,但可减少 agent 侧输出开销,为 agent 工具化的修复结果与成本提供了量化测量。
「编程与Agent」频道最新
- AgentWorld 研究:多智能体协作任务成功率仅 12% — omarsar0 · 2026-10-02
- 开发者用 GPT 复刻 DOOM 类游戏,血腥度还原原版并即将开源 — DeryaTR_ · 2026-10-02
- 把 AI Agent 接进 homelab:让智能体真实操作自己的服务器 — Academic_Wolverine · 2026-10-02
- 用流程挖掘 agent 审计企业工作流:文档写 7 步,实际 20 步 — vasuman · 2026-10-02
- Geoffrey Huntley 反驳「两周后大家都得回去读代码」 — kieranklaassen · 2026-10-02
- Claude Skills 入门:从 PDF 填表看提示词与 Skill 的真正区别 — lxfater · 2026-10-02