博弈论与机器学习交汇:单/多智能体学习与均衡综述
bronzeagepapi · x · 2026-08-12
Panayotis Mertikopoulos 发布了关于博弈中学习理论的综述论文。文章从单智能体在未知对抗环境下的序列决策,延伸到多智能体交互环境。
核心探讨了基于正则化的学习策略,通过惩罚项鼓励探索并避免陷入次优选择。论文给出了对抗性多臂老虎机的遗憾界,证明了零和博弈中的均衡收敛性,并揭示了纳什均衡与动态稳定性的关联。
「研究」频道最新
- LLM 持续学习方法 iSDFT 开源:500+ 实验平衡可塑性与稳定性 — hbouammar · 2026-09-23
- 多项式 Freiman-Ruzsa 定理留下算法难题:如何高效找到子空间 — gautamcgoel · 2026-09-23
- 研究员论证:堆并行 agent 是弱路径,RSI 需要更强 agent — gleech · 2026-09-23
- Courtade–Kumar 猜想获证明:信息论经典问题给出多比特扩展 — abeirami · 2026-09-23
- TimePre 论文登 TMLR:可逆归一化稳住概率时序预测的多假设学习 — _vztu · 2026-09-23
- Agent评测缺的不是榜单 而是可复现的轨迹与日志 — seanwbren · 2026-09-23