4B模型媲美30B!上交大ABSeeker提出细粒度步级奖励训练搜索智能体

SJTU · hf · 2026-08-06

上海交通大学提出 Answer-Backtracked Credit Assignment (ABC) 框架,旨在解决长程搜索智能体训练中轨迹内所有动作被同等对待的问题。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →