清华与贝壳提出 DRIFT 框架:突破大模型在线自进化瓶颈
青稞AI · wechat · 2026-07-26
清华大学、贝壳及巴黎高师的研究团队提出了一种名为 DRIFT 的大模型在线自进化后训练框架,旨在解决 RL 之后模型如何持续进化且不崩溃的难题。
该框架的核心机制包括:
- 动态难度路由与节拍门控探索:帮助模型精准识别关键推理节点,决定何时该进行强化学习,何时该进行自蒸馏。
- 成功记忆库:结合课程学习,实现更加稳定的策略优化。
实验表明,DRIFT 能在无外部专家监督的情况下实现模型的自我纠错与持续进化,并在多个复杂推理和工具使用(Tool Use)基准上取得新的 SOTA。原作者将于近期举办线上分享会,深度解析该算法的设计动机与理论思考。
「研究」频道最新
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一份横跨 ML、系统、NLP 与音频的经典论文清单 — deliprao · 2026-07-27
- TechCrunch 讨论脑波信号或成 physical AI 训练新钥匙 — TechCrunch AI · 2026-07-27
- NeurIPS 反驳阶段临近:如何写出高质量回复? — furongh · 2026-07-27
- 一篇名为“在康托空间没人听见你流”的计算机论文 — fkasummer · 2026-07-27