业界探讨在线RL路径:从真实交互轨迹构建任务飞轮
针对「模型能否稳健解决复杂任务并具备商业可行性」的讨论,有观点指出当前的朴素方案虽能大致跑通,但成本高、调试繁琐、适用范围有限。业界认为真正在真实场景中效果最好的做法,是从真实交互轨迹出发构建任务飞轮,实现在线强化学习。另有从业者讨论个性化持续学习的实现路径,认为当下主要依赖精细的 harness 工程,以及面向记忆与多智能体的长程 RL,从交互轨迹中做在线强化。
2026-09-19 ~ 2026-09-19 · 2 条相关
- 在线RL才是当前真正可用的方案:从真实交互轨迹构建任务飞轮 — willcb · 2026-09-19
- 连续学习现状:靠 harness 工程加长程 RL 从交互轨迹做在线强化 — willcb · 2026-09-19