主流本地模型大比武:Opus 4.8 与 DeepSeek/Qwen/GLM 跑分
perelmanych · reddit · 2026-09-01
汇总了 DeepSeek-V4-Flash、Qwen3.8、GLM-5.3 等当前流行本地模型与 Opus 4.8 的基准测试成绩。覆盖 Agent 能力、编程、通用能力及多模态四大类。数据显示,DeepSeek 和 Qwen 在多项测试中表现强劲,Opus 4.8 仍具竞争力;表格包含 Terminal Bench、SWE-bench、GPQA Diamond 等具体分数。
「模型」频道最新
- Anthropic 员工也看不懂 Claude 在说什么 — sanderssays · 2026-09-01
- 求助:ChatGPT 5.6 Luna 对比 Grok 与 Gemini — Random-poster-24495 · 2026-09-01
- 双订阅用户实测:OpenAI Sol 只配对标 Opus,远逊 Fable — DynaBeast · 2026-09-01
- Codex 疑将放弃反复压缩上下文,改用换班式外部记忆机制 — 量子位 · 2026-09-01
- GLM 5.3 Flash 本地跑通 Blender/Unity 接口 — antirez · 2026-09-01
- 工程师直言:LLM 缺乏「自知之明」的自我校准能力 — akbirthko · 2026-09-01