榜单显示 Kimi K3 综合 79.2,但 agentic coding 仍是短板
teortaxesTex · x · 2026-08-04
这张榜单截图展示了多款前沿模型在不同维度上的对比,Claude Fable 5 Max Effort 和 GPT-5.6 Sol Max Effort 暂列前排。
- 表格覆盖了 推理、编码、Agentic Coding、数学、数据分析、语言、指令遵循 等指标。
- 其中 Kimi K3 综合分 79.2,Muse Spark 1.1 xHigh Effort 为 75.3,DeepSeek V4 Flash 0731 为 74.2。
- 发帖人的重点判断是:Bindu 的 “Whale” 在原生评测环境里大概率会排到 Muse Spark 之上,因为差距最大的地方出在 agentic coding。
「模型」频道最新
- Baseten 测试 Laguna S 2.1 改造 715 文件 C++ 游戏 — baseten · 2026-08-04
- Nous 联创称 Hermes Agent 的记忆和技能栈比底座模型更重要 — petergyang · 2026-08-04
- 发帖者称 DeepSeek 这次输出胜过 GPT-5.6 Sol — yacineMTB · 2026-08-04
- Kimi 和 GLM 5.2 定价继续下探,模型跨平台迁移加速 — markjeffrey · 2026-08-04
- OpenAI 揭秘:6 个月打造 GPT 实时低延迟语音系统 — borowcy · 2026-08-04
- 基准测试称前沿模型仍难正确实现基础 PDE 求解器 — GaryMarcus · 2026-08-04