自定义搜索 RL 训练,可能比“单一大模型”更有效

shangbinfeng · x · 2026-08-04

这条转发的核心观点是:如果还相信“一个大模型包打天下”,不妨试试把模型放到自定义搜索 harness 和具体任务里做 RL,效果曲线会很快向上。

作者想表达的是,很多真实工作里决定上限的,不只是模型本身,而是环境、反馈回路和任务设计;做对这些,agent 系统可能比单一大模型更有用。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →