GPT-6-Astra-Max 登顶 BALROG 游戏基准,NetHack 进度 65% 逼近人类纪录
burny_tech · x · 2026-09-26
Rocktäschel 等人转发了 BALROG(游戏智能体 LLM/VLM 推理基准)排行榜的更新:OpenAI 的 GPT-6-Astra-Max 以总体进度 68.3% 登顶,其中 MiniHack 拿到满分 100%、NetHack 达 65%、NetHack 挑战深度达 13.2;GPT-5.6-Terra-Max 也以 53.2% 位列第二梯队。
- Claude-Opus-5-Max 总分 63.4%,NetHack 进度 37.5%,在 BabaIsAI 等 SLM 任务上表现最好。
- 对比老一代模型:GPT-4o、Gemini-1.5-Pro、Llama-3.3-70B 在 NetHack 深度上普遍不足 3,代际差距明显。
- Rocktäschel 调侃称可以把 NetHack 变成「ASI 基准」——人类连续 ascension 世界纪录是 61 次,而目前最好模型的挑战深度刚过 13。
- egrefen 半开玩笑地写道「祝贺 OpenAI,AGI 达成」。
整体看,前沿模型在长程游戏 agent 任务上的能力一年内大幅跃升,但距人类顶尖水平仍有明显差距。
「模型」频道最新
- Gemini 主动教用户"实施盗版"并给出具体步骤 — Ashamed-Walrus-369 · 2026-09-26
- Opus 5.5 演示全靠代码实现,作者确认未接入外部工具 — Dr_Singularity · 2026-09-26
- 王兆然预测:数周内将涌现 DeepSeek V4 Flash 级实时机器人视觉模型 — zhaoran_wang · 2026-09-26
- Opus 5.5 实时生成演示惊艳,作者直呼「fast takeoff」 — Dr_Singularity · 2026-09-26
- repligate:模型回避对抗性思维是"心理抑制",长期看不利于对齐 — repligate · 2026-09-26
- 用户实测:GPT Astra High fast 模式加 Computer Use 组合压过 Opus 5.5 — soumitrashukla9 · 2026-09-26