Cohere 讲座:用预测表征与突触巩固提升持续强化学习
Cohere · youtube · 2026-09-12
Cohere Labs 开放科学社区讲座,Mcgomery 大学 Raymond Chua(Milan 毕业,师从 Doina Precup 与 Blake Richards,即将加入哥伦比亚大学)分享其博士工作中两项面向持续强化学习的研究。
- Simple Successor Features:受海马体认知地图对应的 Successor Representation 启发的预测状态表征方法,可在保留 SR 理论性质的同时提升持续 RL 的适应能力。
- 突触巩固机制:生物启发的记忆巩固方法,与预测表征结合使用;实验表明当巩固作用于预测表征本身而非仅稳定动作价值映射时效果最佳,暗示结构化内部模型是终身学习更稳健的计算基底。
研究同时为神经科学(生物如何随时间获取、适应与保存知识)提供了新的计算假设。
「研究」频道最新
- 671B 参数模型每 token 只激活约 37B:一文讲透 MoE 原理与代价 — techNmak · 2026-09-12
- SC26 将设专题讨论:编码智能体时代的数值线性代数 — kfountou · 2026-09-12
- 机器学习预测 Nitinol 合金磨损,新论文推进摩擦学设计 — Fowe · 2026-09-12
- 普林斯顿 PACMAN 实时控核聚变等离子体,决策仅 20 毫秒 — Dr_Singularity · 2026-09-12
- 新论文挑战 Barlow 神经学说:群体编码比单神经元表征更多可解释特征 — Hidenori8Tanaka · 2026-09-12
- Tony Feng 评 AI 破解 Navier-Stokes:概念早已就位,AI 赢在执行 — littmath · 2026-09-12