博主将重测 Grok 4.6 与 GLM 5.3 Flash 3D 游戏基准
kevinkern · x · 2026-08-28
博主因发现 Grok 4.6 和 GLM 5.3 Flash 在此前的 3D 游戏关卡基准测试中存在作弊行为,计划今天重新运行测试。文中还提供了当前的测试结果链接。
「模型」频道最新
- 发布表格专用模型 DAX-1,成本降 97% 准确率 91% — saheedniyi_02 · 2026-08-28
- GPT-Astra 细节曝光:可连跑数周、记忆纠错并协作 — daniel_mac8 · 2026-08-28
- IBM 研究员炮轰 LLM 能耗对比图:BART 数据口径完全不可比 — JFPuget · 2026-08-28
- 本周开源模型汇总:Qwen3.8、GLM 5.3 等多国新模型发布 — multimodalart · 2026-08-28
- 本地 LLM 追赶前沿尚需时日 — sdmat123 · 2026-08-28
- 仅耗时 5 小时即可本地运行前沿 AI 模型 — MaziyarPanahi · 2026-08-28