RSIAgent:不训练一参数,靠环境探索让开源模型胜过 GPT-6
大模型之路 · wechat · 2026-09-24
9 月 14 日挂上 arXiv 的 RSIAgent 提出一种 training-free 智能体方案:面对陌生环境先并行「广逛」摸清界面结构,再针对难点深挖,由课程智能体(决定探索什么)、执行者(实际操作)、验证者(证伪确认)三角色协作,产出一份冻结的「环境专属记忆」供下游任务复用,全程不更新模型权重。
关键结论与论证:
- 论文自称靠这份环境记忆,Kimi-K3 和 GLM-5.3 在 OSWorld-v2 与 Agent's Last Exam 上超过包括 GPT-6 在内的前沿闭源模型(注意:作者自家对照,非第三方盲测)。
- 核心论点:智能体能力短板常在「对环境的了解」而非「模型权重」——把杠杆从算力侧挪到工程侧,对训不起前沿模型的中小团队尤其友好。
- 佐证线索:Show-Harness 主张机器人缺的是更好的接口而非新模型;另一项研究发现十三套 RL 数据配方全部跑不过随机选。
落地要点与边界:
- 界面固定、任务多样的内部系统最划算:探索是一次性固定成本,探索一次、冻结复用。
- 局限:UI 频繁发版时冻结的地图会过期,需配轻量定期重探;环境随机或任务极简时探索反而浪费。
所属事件:RSIAgent 免训练自改进框架让开源模型胜过 GPT-6(3 条相关)→
「编程与Agent」频道最新
- GPT-6 Astra + Jev 通关《求生之路2》:5 战役 23 章,耗时 13.8 小时 — imjustnewatai · 2026-09-26
- AI-first 时代做项目,你自己的理解也成了交付物 — brandon_xyzw · 2026-09-26
- DHH 称进入后开发时代,质疑者反问:为何执着 Rust — kristoph · 2026-09-26
- Sentry CEO:RAG 没死,上下文获取与优化仍是好 agent 的核心 — zeeg · 2026-09-26
- 用户让车里的 Grok 自动办停车证,建 bot 搜表单填完还盯消息 — Baconbrix · 2026-09-26
- Railway 推出免注册免费 VM,59 分钟起可跑智能体 — jasonkneen · 2026-09-26