MazeBench 新榜:Gemini 3.7 Flash 得分 1% 领跑
SimplyAnnisa · x · 2026-08-24
MazeBench 公布了新的模型评测结果,在迷宫测试中,大多数顶尖模型(包括 ox-alpha、Grok 4.6、GLM-5.3、Qwen 3.8-max)得分均为 0%。表现最好的是 Gemini 3.7 Flash,得分 1%,略优于 Kimi K3。
所属事件:MazeBench 新榜:多数旗舰模型迷宫任务得零分(3 条相关)→
「模型」频道最新
- MiniMax 官宣:GMI Cloud 上 M3/M2.7 等 14 天无限量免费 — MiniMax_AI · 2026-08-25
- 用户称 Ox Alpha 持续变强,推测具备每日自我修改能力 — kimmonismus · 2026-08-25
- Anthropic 抱怨蒸馏遭反驳:Kimi、GLM 已免费提供前沿能力 — Leafytreedev · 2026-08-25
- GPT-5.6 Sol 模型降价:输入输出分别降至 4/10 美元 — MatthewBerman · 2026-08-25
- 为 MiniMax H3 生成 Prompt,哪个本地模型最强? — orlandogourmet66 · 2026-08-25
- 别只信基准测试:如何在真实工作环境中评测 LLM? — WhatererBlah555 · 2026-08-25