GLM-5.3 登顶 EQ-Bench v4,分析能力得分罕见达 9.1
airesearch12 · x · 2026-08-19
EQ-Bench v4 基准测试结果显示,Zaiorg 的 GLM-5.3 取得极其积极的成果,以较大幅度超越此前开源冠军 K3 及 Fable 等最强商业模型。GLM-5.3 被定义为“直接分析师”人格,而非“和谐寻求者”或“讨好者”。其分析得分高达 9.1,但也因过于机器化而引发讨论。
「模型」频道最新
- Grok 4.6 在 ForgeCAD 画笔:测试模型对物理产品内部结构的认知 — MarvinTBaumann · 2026-08-19
- Fable 5 能写代码却不能审计安全,用户吐槽规则矛盾 — Few_Object_2682 · 2026-08-19
- 实测 GPT Pro 推理深度碾压对手:发现跨研究关联并纠正数据 — PromptOutlaw · 2026-08-19
- Mistral与前沿模型在网安领域差距巨大 — emollick · 2026-08-19
- Reddit 讨论:为何 AI 延长思考能提升效果?原理是什么 — Neat_Initiative_7780 · 2026-08-19
- NVIDIA 论文:混合 Mamba-Transformer 模型 Nemotron-H — cwolferesearch · 2026-08-19