清华与贝壳提出 DRIFT 框架:突破大模型在线自进化瓶颈
青稞AI · wechat · 2026-07-26
清华大学、贝壳及巴黎高师的研究团队提出了一种名为 DRIFT 的大模型在线自进化后训练框架,旨在解决 RL 之后模型如何持续进化且不崩溃的难题。
该框架的核心机制包括:
- 动态难度路由与节拍门控探索:帮助模型精准识别关键推理节点,决定何时该进行强化学习,何时该进行自蒸馏。
- 成功记忆库:结合课程学习,实现更加稳定的策略优化。
实验表明,DRIFT 能在无外部专家监督的情况下实现模型的自我纠错与持续进化,并在多个复杂推理和工具使用(Tool Use)基准上取得新的 SOTA。原作者将于近期举办线上分享会,深度解析该算法的设计动机与理论思考。
「研究」频道最新
- 一万个智能体能否突破反向传播,找到更好的学习算法 — SeunghyunSEO7 · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- VidMap 用 RoMa 粗匹配全帧、精细匹配仅限关键帧 — ducha_aiki · 2026-09-11
- Bug Hunt Bench 作者补充:榜单噪声幅度约 2-3 分 — PawelHuryn · 2026-09-11
- 台球计算模型登 PNAS:二维系统已存在不可判定性,可跑通用计算机 — eigensteve · 2026-09-11
- 新研究:从仿射变换与重力线索求解绝对位姿 — ducha_aiki · 2026-09-11