RLM 把上下文当 REPL 变量,长链推理准确率从 2.6% 升至 45.4%
AI Engineer · youtube · 2026-09-09
AlixPartners 高级技术总监 Kevin Madura 在 AI Engineer 演讲中介绍递归语言模型(RLM)的核心思路。
- 核心机制:RLM 把整个上下文当作 REPL 环境中的对象(变量),而非必须逐 token 注意的内容,可以对输入切片、计算、迭代;模型用几行正则即可完成“在 3 万 token 中求 12 个数之和”这类长上下文任务。
- 递归委派:RLM 可把子问题递归委派给另一个模型(包括自己),只把关键结果返回主上下文,避免 RAG 式塞满窗口导致的上下文腐烂。
- 对比现状:RAG 会让质量退化;agent/工具调用在 JSON 字符串间搬运,逻辑、执行、结果松耦合;RLM 将三者放在同一环境。
- 成绩:在长思维链 benchmark 上准确率从 2.6% 提升至 45.4%,可归约为代码的任务收益最大。
- 案例:无分块/嵌入的发票合并、原始日志模式挖掘、从自身 trace 优化 agent harness、对 50 万行代码生成安全报告。
- 判断:未来经过 RLM-aware 后训练的模型会让这套范式更加成熟。
「漫话AGI」频道最新
- 研究员批AI安全界混淆风险叙事:错误恐惧正在毁掉公众想象力 — Dr_Atoosa · 2026-09-11
- 安全从业者反思:廉价化的「AI 灭绝风险」话语如何毁掉公众想象力 — Dr_Atoosa · 2026-09-11
- 技术假说:ASI 会因数学激励而永久保护人类多样性 — No_Cause_2731 · 2026-09-11
- 博客提出:Scaling Laws 的根源在数据结构而非模型架构 — gleech · 2026-09-11
- AI 末日论甚嚣尘上,Reddit 求乐观共存的反方论证 — joshlove182 · 2026-09-11
- BlackHC:当前模型 x-risk 低,但不改变路径几年内风险会大增 — BlackHC · 2026-09-11