STS2-Bench:测长程决策的基准

MrBoxChen · reddit · 2026-07-12

作者提出了一个新基准 **STS2-Bench**,用 *Slay the Spire 2* 测试模型的长时程决策能力。 ### 核心思路 不是让模型回答单个问题,而是让它在整局游戏里持续决策: - 读取不断变化的状态 - 权衡短期收益和长期生存 - 在不确定性下选择卡牌、路线和资源 - 每轮之后根据结果调整策略 ### 实验与发现 - 作者在同一框架下评测了 7 组模型/配置 - 其中 **5.6Sol** 在这种序列决策任务上表现出乎意料地好 - 作者明确表示:这不应被视为通用智能排名,但它可能揭示了传统单轮 benchmark 看不到的信号 ### 作者希望得到的反馈 - 这种游戏任务是否适合作为规划与长程推理的代理指标 - 还需要哪些控制变量或基线让评测更可信 - 还有哪些游戏或环境适合做这类 benchmark

所属事件:STS2-Bench 用爬塔 2 评测模型长程决策(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →