8款前沿大模型横评:10维度50细项,两轮测试出双榜
lxfater · x · 2026-08-17
开发者 servasyyai 花两天时间、消耗大量 token,对 8 款前沿大模型做了 10 个维度(D1–D10)、共 50 个细项的能力横评;每个细项按 0–5 打分,再汇总为 100 分制总分。
文章同时保留两张原始榜(Round 1 一次性复杂任务榜与 Round 2 榜)和一张综合参考榜,以降低单轮测试的偶然性。转发者 lxfater 吐槽「太长了,直接说结论」😂,完整榜单见原文链接。
「模型」频道最新
- Qwen3.8-27B GGUF 量化版登顶 Hugging Face 趋势榜 — AtomicChat · 2026-08-17
- 用户实测豆包: coding 能力远不及 Codex 与 Claude — Sad-hurt-and-depress · 2026-08-17
- GPT-5.6 luna 降价后性价比极高,延迟大降 — haider1 · 2026-08-17
- GLM 5.3 网络安全评测表现亮眼,低成本优势利好防御性安全工作 — ccerrato147 · 2026-08-17
- DeepSeek V4 Flash 严重输出乱码与幻觉指令 — Venersiss · 2026-08-17
- GLM5.2 被曝在非中英文提示词中错误采样语言 — kalomaze · 2026-08-17