flow-1 发布:RL 训练的 agent 轨迹纠错模型,比 GPT-6-sol 便宜 23 倍

kalyan_kpl · x · 2026-10-06

新模型 flow-1 用 RL 训练,专门用于发现 agent 轨迹中的错误。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →