Toloka 用一轮企业 RL 数据,Qwen3.5-27B 零售 agent 基准提升 8.9pp
MParakhin · x · 2026-10-09
Toloka 用自家现成(OTS)企业工具使用数据集对 Qwen3.5-27B 做了一轮 RL 后训练,再在从未见过训练数据的 agent 基准上测试,取得显著提升:
- 外部基准:τ³ retail 从 77.6% 升至 86.8%(+8.9pp,95% CI [+4.5, +13.6]);AutomationBench Operations 部分得分 +9.6pp、Support +7.6pp;Toolathlon +4.3pp
- 跨域迁移:完全未参与训练的一个 OTS 环境 pass 率从 14.0% 升至 58.0%(+44.0pp)
- held-out 任务:pass 率 41.6%→64.5%(+22.8pp),三次尝试全通过的任务占比从 22.9% 翻倍至 46.4%
- 奖励设计:同等训练步数下,基于 OTS 自带 rubric 的奖励比二元 pass/fail 奖励高 +9.4pp
核心结论:模型学到的是「改东西之前先查策略/规则」这类企业工作流习惯,提升在训练环境相近的基准上最明显,方法细节与数据见其博客。
「编程与Agent」频道最新
- 号称最快 Agent 模型 Jev:毫秒级决策近零成本,10 个用例详解 — Arindam_1729 · 2026-10-09
- LLM 该不该写测试?开发者:测试暴露内存装不下的问题,值得写 — ivan_bezdomny · 2026-10-09
- 马斯克晒 Grok 一句话装好 16 个游戏模拟器 — elonmusk · 2026-10-09
- Retell AI 推出原生会话记忆,语音 agent 一键记住来电者 — ycombinator · 2026-10-09
- 评估代码库对 Agent 友好度的新启发:「全自动重写」需要多久 — HankYeomans · 2026-10-09
- Paper Mono 发布视频全程由代码生成,作者一行未改 — eschadiol · 2026-10-09