IBM 发布 DRACO:动态评分细粒度信用分配,训练长程智能体免验证器
ibm-research · hf · 2026-09-04
- IBM Research 在 Hugging Face 发布 DRACO,面向长程智能体(long-horizon agent)的强化学习训练。
- 核心方法:动态生成评分细则(rubrics),把轨迹级奖励重新分配为逐步(per-step)优势,无需验证器(verifier)即可完成信用分配。
- 宣称能提升长程智能体任务的强化学习表现。
「编程与Agent」频道最新
- Intent 更新主打大规模 Agent 协调:多智能体分工、工作区隔离 — LukeW · 2026-09-04
- Intent 更新:一个任务多 agent 协同,工作区隔离多设备运行 — LukeW · 2026-09-04
- 投资人支招 Agentic 创业路演:别只展示成功,讲清失败怎么恢复 — atShruti · 2026-09-04
- 开发者用 WebMCP 让 AI 当 DJ:数百次工具调用实时控打碟台 — No_Guide_8697 · 2026-09-04
- 让用户放心把邮箱交给 agent 的,竟是整理 Newsletter 这种小事 — JanJanJaJa · 2026-09-04
- Kafka、Kafka Connect 与 Schema Registry 变身原生 MCP 工具 — jkriket · 2026-09-04