BALROG 榜更新:GPT Astra 6 刷新纪录,Opus 级评论称离 AGI 尚远
_rockt · x · 2026-09-19
BALROG 基准排行榜新增三条结果:GPT 5.6 Sol 在 max effort 下与 Gemini 3 / 3.1 Pro 成绩仍在误差范围内,而 GPT Astra 6 在 max reasoning effort 下达到新高度,在 NetHack Learning Environment 上取得 13% 的平均进度。研究员 rockt 评论称「进展很大,但还不是 AGI」。
「模型」频道最新
- 开发者吐槽 DeepSeek 新模型:像「超级蒸馏版 Claude」却丢了智力 — Aryvyo · 2026-09-19
- 小米 AI 十条人设曝光:明日发布统一大模型 Xiaomi MiMo — xiaohu · 2026-09-19
- 用转向向量替代硬截断限制模型思考预算? — maddie-lovelace · 2026-09-19
- 两段提示词实测:你的 ChatGPT 为何总答偏 — KazTheMerc · 2026-09-19
- MMLU 基准约 6.5% 题目有错,57% 病毒学子集被人工标注出问题 — PMinervini · 2026-09-19
- Jev 结构化输出模型爆红,Yegge 主张用围栏取代沙箱管 Agent — njyx · 2026-09-19