新框架仅凭神经活动记录即可在仿真中学出可迁移干预策略
wgilpin0 · x · 2026-10-09
Emonds 与 Koppe 在 arXiv 发布论文 Learning Transferable Policies from Action-free Time Series Through Dynamical Embeddings,研究如何只从无动作记录的时间序列(如神经活动与行为数据)学习控制策略。
核心思路:
- 层级动力学重建模型通过低维嵌入捕捉相关系统间的共享结构与个体差异;
- 嵌入复用于共享策略与价值网络参数化,把动力学差异与控制差异关联起来;
- 策略完全在仿真中训练,配合显式干预模型与分段线性 RNN,使干预效果可解释,并能在操控一个模态的同时保护另一模态。
在 Lorenz-63 与双摆系统上,层级策略比独立训练策略迁移性更好,接近有交互数据训练的方法,且能泛化到训练中未见过的系统。作者用神经数据训练模型、在仿真中学习抑制运动的干预,无需真实干预记录。
「研究」频道最新
- U-Space:用机制可解释性找到 LLM 内部「不确定子空间」,无需训练可测信心 — Tobias Braun · 2026-10-09
- CARE:带统计保证的 VLA 推理加速认证,OpenVLA-OFT 提速 9-10.8 倍 — UMCP · 2026-10-09
- 评测文本扩散模型太难?新方法 SOL 用样本分布距离破局 — NandoDF · 2026-10-09
- MaRN 库用低维参数映射压缩网络:MNIST CNN 参数减 57.7 倍 — Less_Dream_6331 · 2026-10-09
- AI 进塔木德研讨会:专家意见分歧时如何评测 AI 成了难题 — EhudReiter · 2026-10-09
- TRL v1.15 融合 LM head,峰值显存省 82%、序列长 7 倍 — QGallouedec · 2026-10-09