主流本地模型大比武:Opus 4.8 与 DeepSeek/Qwen/GLM 跑分

perelmanych · reddit · 2026-09-01

汇总了 DeepSeek-V4-Flash、Qwen3.8、GLM-5.3 等当前流行本地模型与 Opus 4.8 的基准测试成绩。覆盖 Agent 能力、编程、通用能力及多模态四大类。数据显示,DeepSeek 和 Qwen 在多项测试中表现强劲,Opus 4.8 仍具竞争力;表格包含 Terminal Bench、SWE-bench、GPQA Diamond 等具体分数。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →