GLM-5.3 跑分超 Sol 与 Opus,登顶 Terminal-bench-4.0
nijfranck · x · 2026-08-29
在全新的 Terminal-bench-4.0 基准测试中,GLM-5.3 的表现超越了 Sol 和 Opus 模型,虽然 Anthropic 的模型仍占据前列,但该结果质疑了市场宣传与实际表现的差距。
「模型」频道最新
- rednote 发布开源多模态智能体模型,支持 512K 上下文 — aftahi_ai · 2026-08-29
- 实测发现 DeepSeek 俄语流利度领先中系大模型 — teortaxesTex · 2026-08-29
- Qwen 模型不同思维级别的表现对比 — Tall_Abrocoma_3533 · 2026-08-29
- 通过技巧让 Claude 暴露隐藏思考 Token — Rare-Paint3719 · 2026-08-29
- 为何 GPT-5.x 模型在代码审查中优于 Claude — dejavucoder · 2026-08-29
- 用户反馈:thinking 模式输出风格疑似被改 — Kittu_Mitthu · 2026-08-29