Toloka 用一轮企业 RL 数据,Qwen3.5-27B 零售 agent 基准提升 8.9pp

MParakhin · x · 2026-10-09

Toloka 用自家现成(OTS)企业工具使用数据集对 Qwen3.5-27B 做了一轮 RL 后训练,再在从未见过训练数据的 agent 基准上测试,取得显著提升:

核心结论:模型学到的是「改东西之前先查策略/规则」这类企业工作流习惯,提升在训练环境相近的基准上最明显,方法细节与数据见其博客。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →