用预测市场训练LLM模拟个体行为,零样本迁移提升15.5分
youjiaxuan · x · 2026-10-08
研究者发布论文 macro2mind,提出用预测市场的价格轨迹训练 LLM 进行行为推理,无需个体级标注数据。
- 方法:用 GRPO 训练语言模型,通过社会行为分解把行为推理变成预测的显式步骤——模型推断代表性市场参与者群体、预测各自如何解读新闻并更新信念、推理其互动,再聚合成价格。
- 训练技巧:采用 hindsight-regret 课程与难度感知采样,聚焦于事后识别群体能显著改善预测、且对当前策略仍可学习的样本。
- 效果:在 SWM-Bench 上于 Polymarket 取得 SOTA 方向准确率与相关性;在无额外训练下零样本迁移到四个用户模拟基准(Humanual、OvertonBench、PRISM、CAD),未见用户模拟准确率提升 15.5 分。
论文由 Yining Zhao 等 8 人完成,Jiaxuan You 为通讯作者。
「研究」频道最新
- 用流体造计算机:作者动手模拟 OpenAI 论文中的 Navier–Stokes 图灵机 — kfountou · 2026-10-08
- D-OPCD 把 Agent 经验蒸馏进扩散模型权重,四基准平均分升至 65.09 — Wenxuan Wang · 2026-10-08
- 四叉树视觉分词器 QuadTok:省 10% token,ImageNet 达 2.08 gFID — Yucheng Mao · 2026-10-08
- PhysEvo 让冻结模型物理递归自我改进:RoboDojo 42 任务成功率 62% — Wenqing Tian · 2026-10-08
- RL 视角解释 On-policy 蒸馏崩溃:隐性奖励被 hack 导致冗长重复输出 — Han Cui · 2026-10-08
- SketchSSM 论文:线性注意力解码提速 7.3 倍,状态流量降 10 倍 — sehoonkim418 · 2026-10-08