任务调度即老虎机问题:FLD 论文详解人类运动学习中的连续时间 Bandit
breadli428 · x · 2026-09-30
作者回复网友提问,解释其工作中调度器(teacher)基于学习进度(learning progress)信号做决策,本质上是一个 bandit 问题。
作者进一步指出,连续时间 bandit 在人类运动学习中的扩展应用,可参考 FLD 论文附录 A.2.6 中的具体示例。
「研究」频道最新
- LlamaIndex 创始人对话 Snorkel AI:RL 环境的「公平性」难题 — ajratner · 2026-09-30
- Phylo 联手帕金森基金会推出 Target Atlas — KexinHuang5 · 2026-09-30
- UIST 2026 论文 Tempo:让计算机使用智能体理解你的长期目标 — kenziyuliu · 2026-09-30
- 数百个 AI agent 并行筛药:Target Atlas 详解 — KexinHuang5 · 2026-09-30
- JevBench 作者宣布将测 OpenAI Decisions API — airesearch12 · 2026-09-30
- UMAP 作者预告新版本:为超大规模数据优化扩展性 — leland_mcinnes · 2026-09-30