STS2-Bench:测长程决策的基准
MrBoxChen · reddit · 2026-07-12
作者提出了一个新基准 STS2-Bench,用 Slay the Spire 2 测试模型的长时程决策能力。
核心思路
不是让模型回答单个问题,而是让它在整局游戏里持续决策:
- 读取不断变化的状态
- 权衡短期收益和长期生存
- 在不确定性下选择卡牌、路线和资源
- 每轮之后根据结果调整策略
实验与发现
- 作者在同一框架下评测了 7 组模型/配置
- 其中 5.6Sol 在这种序列决策任务上表现出乎意料地好
- 作者明确表示:这不应被视为通用智能排名,但它可能揭示了传统单轮 benchmark 看不到的信号
作者希望得到的反馈
- 这种游戏任务是否适合作为规划与长程推理的代理指标
- 还需要哪些控制变量或基线让评测更可信
- 还有哪些游戏或环境适合做这类 benchmark
所属事件:STS2-Bench 用爬塔 2 评测模型长程决策(2 条相关)→
「研究」频道最新
- AI 智能体协作优化 secp256k1 量子电路,挑战打破 ECDSA — StefanoGogioso · 2026-09-11
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11
- 本周热议的数学猜想到底关我什么事?一张普通人视角清单 — koltregaskes · 2026-09-11
- 用果蝇大脑连接组造了个 LLM,作者放出在线 demo — ngxson · 2026-09-11
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11
- 「Waymo 效应」:AI 正在悄悄让科研协作变少 — JohnHammersley · 2026-09-11