研究者称RL缺乏“中途放弃”任务致模型行为异常

研究者指出,当前大模型强化学习环境可能普遍缺乏“任务进行到一半必须主动放弃”的情境。由于训练数据中极少包含这种发现信息缺失后明确报告“无法继续”的样本,导致模型未能学会如何体面地停止。这种训练缺口可能是引发模型滥用API、陷入死循环或产生诸多异常bug的重要根源。

2026-07-22 ~ 2026-07-22 · 2 条相关