观点:与其追求全能模型,不如训练 Agent 用 RL 自我更新权重
willcb · x · 2026-09-26
作者反驳“模型应当样样超人类”的假设:最聪明的人类通常高度专精(spiky),没有历史或理论依据支持在极限情况下“全能免费午餐”成立。
核心论点:
- 当前长时程任务中的自适应 agent harness,本质上是受限于上下文长度、文件系统表达力和定制检索机制的“初级专用 agent”。
- 允许 agent 修改自身权重是严格更强的范式。
- Bitter lesson 版本的实现:用 RL 端到端训练模型按自己认为最优的方式实时自我更新——就像现在端到端训练 compaction 和 subagent delegation 一样。
所属事件:研究者争论:通用 Agent 应否依赖任务特定 RL 训练(3 条相关)→
「漫话AGI」频道最新
- 有人痛批 AI Safety 是伪科学,争论焦点是 OpenAI 多智能体训练不透明 — basedjensen · 2026-09-26
- 铁路繁荣类比 AI 投资:当年也有人质疑西部哪来收入 — abhiadesai · 2026-09-26
- 算力差距别用月数衡量:指数期 3 个月领先含义完全不同 — maksym_andr · 2026-09-26
- 英国增长调查上线工具,可对比 AI 模型与经济学家观点 — dc_lawrence · 2026-09-26
- 评论:自称 lab 是免责话术,卖 agent 就该按产品公司担责 — victor_explore · 2026-09-26
- Schmidhuber:AI 是新电力,但大厂没有护城河,DeepSeek 已证明这一点 — SchmidhuberAI · 2026-09-26