业界探讨在线RL路径:从真实交互轨迹构建任务飞轮

针对「模型能否稳健解决复杂任务并具备商业可行性」的讨论,有观点指出当前的朴素方案虽能大致跑通,但成本高、调试繁琐、适用范围有限。业界认为真正在真实场景中效果最好的做法,是从真实交互轨迹出发构建任务飞轮,实现在线强化学习。另有从业者讨论个性化持续学习的实现路径,认为当下主要依赖精细的 harness 工程,以及面向记忆与多智能体的长程 RL,从交互轨迹中做在线强化。

2026-09-19 ~ 2026-09-19 · 2 条相关