Salesforce 用自家 Agent 配置文件做 RL,训出企业 agent 模型 Koa
omarsar0 · x · 2026-09-16
Salesforce 发布企业 agent 模型 Koa,基于开源 Nemotron-3-Super-120B 训练。做法颇具启发性:公司把定义 Agentforce agent 的声明式 Agent Script 规格文件,扩展成带模拟用户人设的多轮任务作为 RL 环境,奖励检查 agent 是否用正确的工具调用完成任务,训练用 GRPO。成绩小幅但稳定提升:Tau2Bench 69.41(基座 68.64,GPT-4.1 为 54.48),CRM Bench 0.86 接近 Claude Opus 4.8 的 0.87,函数调用准确率从 0.71 升至 0.77。作者点评:如果你的公司已用结构化格式描述工作流,这些描述可能可以直接转化为 RL 环境。
「编程与Agent」频道最新
- OpenAI 内部万级 Agent 编排系统曝光,用户版 3 个子代理反被批浪费 token — RexDouglass · 2026-09-16
- 开发者用 GPT-6 重写 Radish:在 Durable Object 里跑 Redis — whoiskatrin · 2026-09-16
- Agent 回答看似全对实则有 Bug,何时才敢放手不复查? — Luvena21 · 2026-09-16
- RSIAgent 不改权重自我进化,两项 agent 基准超 GPT-6 Astra — Roger_M_Taylor · 2026-09-16
- 工程师用 LLM 把知识变成游戏:自建芯片工厂模拟学造芯片 — thehiphopswami · 2026-09-16
- 开源 skill 清除 AI 写作味:识别 41 种套路,4 道关卡把关 — Roger_M_Taylor · 2026-09-16