任务调度即老虎机问题:FLD 论文详解人类运动学习中的连续时间 Bandit

breadli428 · x · 2026-09-30

作者回复网友提问,解释其工作中调度器(teacher)基于学习进度(learning progress)信号做决策,本质上是一个 bandit 问题。

作者进一步指出,连续时间 bandit 在人类运动学习中的扩展应用,可参考 FLD 论文附录 A.2.6 中的具体示例。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →