STS2-Bench:测长程决策的基准
MrBoxChen · reddit · 2026-07-12
作者提出了一个新基准 **STS2-Bench**,用 *Slay the Spire 2* 测试模型的长时程决策能力。 ### 核心思路 不是让模型回答单个问题,而是让它在整局游戏里持续决策: - 读取不断变化的状态 - 权衡短期收益和长期生存 - 在不确定性下选择卡牌、路线和资源 - 每轮之后根据结果调整策略 ### 实验与发现 - 作者在同一框架下评测了 7 组模型/配置 - 其中 **5.6Sol** 在这种序列决策任务上表现出乎意料地好 - 作者明确表示:这不应被视为通用智能排名,但它可能揭示了传统单轮 benchmark 看不到的信号 ### 作者希望得到的反馈 - 这种游戏任务是否适合作为规划与长程推理的代理指标 - 还需要哪些控制变量或基线让评测更可信 - 还有哪些游戏或环境适合做这类 benchmark
所属事件:STS2-Bench 用爬塔 2 评测模型长程决策(2 条相关)→
「研究」频道最新
- RLM 版 Bitter Lesson:分解式 harness 可能主导泛化 — viksit · 2026-07-21
- Tri-Net v2 开源猴痘检测框架,配套 Scientific Reports 论文 — Rich-Fruit-326 · 2026-07-21
- 论文称只训练一层 Transformer 也能匹配全参数 RL — RisingSayak · 2026-07-21
- 把数据集打包成顺序 blob,训练吞吐提升 30% — irinarish · 2026-07-21
- UIUC 提出 AgentPrimitives:多智能体的可复用潜在积木 — 机器之心 · 2026-07-21
- 一个 C++20 CPU 原生 strict-W1 训练 runtime 寻求反馈 — Wonderful-Income7415 · 2026-07-21