4B模型媲美30B!上交大ABSeeker提出细粒度步级奖励训练搜索智能体
SJTU · hf · 2026-08-06
上海交通大学提出 Answer-Backtracked Credit Assignment (ABC) 框架,旨在解决长程搜索智能体训练中轨迹内所有动作被同等对待的问题。
- 核心机制:通过从最终答案回溯恢复中间线索,对每一步搜索动作进行打分,将稀疏的轨迹级结果监督转化为密集的步级奖励,从而奖励有效动作并抑制冗余或错误动作。
- 训练应用:开发了重新加权损失的 ABC-SFT 和使用步级分数作为奖励的 ABC-GRPO。
- 性能表现:基于 Qwen3.5-4B 和仅 8.5k 样本训练出的 ABSeeker,在 BrowseComp 测试中取得优异成绩。结合上下文管理后得分进一步提升至 55.3%(英文)和 52.9%(中文),显著超越同等规模(4B)的智能体,甚至媲美约 30B 规模的更大模型。
「编程与Agent」频道最新
- 终结AI胡编:将模糊任务转化为有明确标准的工程实践 — _ScottCondron · 2026-08-06
- AWS Bedrock 推出 OpenAI 模型原生联网搜索功能 — DigitalColmer · 2026-08-06
- 开发者实测:用 Claude Opus 写 C 代码驱动 ESP32 — petewoodbridge · 2026-08-06
- 弃用生成式视频:用 Agent 自动化拍摄产品演示新思路 — socialwithaayan · 2026-08-06
- 论文提出面向 AI 智能体的 Token 原生存储架构 — bclavie · 2026-08-06
- 生产级语音智能体用什么STT?开发者吐槽:LLM常背锅,问题多在语音链路 — potqtocake · 2026-08-06