连续学习现状:靠 harness 工程加长程 RL 从交互轨迹做在线强化
willcb · x · 2026-09-19
willcb 谈个人化持续学习(personal continual learning)的实现路径:
- 当下主要靠精细的 harness 工程,以及面向记忆与多智能体的长程 RL(long-horizon RL)
- 对每个用户最有价值的实际学习目标是「校准的偏好与反应建模」
- 朴素做法勉强可用,但昂贵、繁琐、适用面窄
- 他认为最有效的方案是从真实交互轨迹中构建「任务飞轮」,再做在线 RL(online RL)
所属事件:业界探讨在线RL路径:从真实交互轨迹构建任务飞轮(2 条相关)→
「编程与Agent」频道最新
- Claude Code 2.1.277 支持 AGENTS.md,无 CLAUDE.md 时自动读取 — eyishazyer · 2026-09-19
- 开源 Jev-cu:给 Codex 装上更快的 computer use,只传文字不传截图 — alexcovo_eth · 2026-09-19
- 实测称 Jev 处理 384 条新闻仅花 $0.19,比 Claude Opus 5 便宜约 390 倍 — airesearch12 · 2026-09-19
- 加缓存前先问 7 个问题:工程师用这套框架避免缓存滥用 — blaizedsouza · 2026-09-19
- 烧掉 15 亿 token 后复盘:Rankpilot 把 API 月成本砍掉 65% — Careful-Key-1958 · 2026-09-19
- 用 PROMPT_SOURCE.md 记录 prompt 历史,证明 AI 项目的人工投入 — niosurfer · 2026-09-19