腾讯混元发布 EvolveScaler 基准:14 个前沿模型最难档中位仅 11.3 分
TencentHunyuan · x · 2026-09-15
腾讯混元推出 EvolveScaler,一个「信息演化」基准:记录会被撤销、修正、回填,答案不在日志里,必须「重放世界」才能回答。
- 构建方式:先把世界定义为可执行状态机(代码保证逻辑),再渲染成自然语言(语言带来混乱)
- 规模:117 个原型、159 个问题算子、5 个难度档,单样本最多约 1200 个事件
- 结果:14 个前沿模型在最难档 avg@5 中位数仅 11.3
- 用于训练:在 8 个分布外基准上平均提升 5.25 分
论文与项目页已发布。
「研究」频道最新
- 微软提出 ESRL:锚定高置信专家提升 MoE 强化学习探索 — MicrosoftResearch · 2026-09-15
- Grouped Value Attention 分组存值按需重建 Key,压缩 KV Cache — Vishesh Tripathi · 2026-09-15
- Amazon MInTRL:稀疏离策略干预提升在线策略 RL 探索 — amazon · 2026-09-15
- 无状态故障转移丢失近 100% 上下文,ContinuityBench 提出 99.2% 保持率方案 — its_vayishu · 2026-09-15
- Phillip Isola 团队另辟蹊径:超快模拟器让 RL 从零起跑 — AjdDavison · 2026-09-15
- 只读前 50 条就漏掉 75% 少数证据:AI 验证器省成本实测 — iMiguelmars · 2026-09-15