图表显示 Kimi K3 在 TerminalBench2.1 上拿到 88.3 分
FinanceYF5 · x · 2026-07-26
这条是同一事件里信息量最完整的一条,配图给出了更具体的评测结果。
图表显示,在 TerminalBench2.1 的 agentic coding 评测中,Nemotron 3 Ultra 只有 53.9 分,Fable5 为 84.6 分,Kimi K3 MXFP4 达到 88.3 分。帖子借此引用 SemiAnalysis 的观点:如果美国想在开源 AI 上保持领先,应该让独立团队彼此竞争,而不是押注单一委员会式训练。
所属事件:SemiAnalysis称Kimi K3胜Nemotron(4 条相关)→
「模型」频道最新
- Baseten 用 247 条虚构事实测试 Qwen3,权重记忆仍不稳 — gerardsans · 2026-07-26
- 早期测试显示 Gemini 3.5 Pro 不再像 3.1 Pro 那样懒 — Able-Line2683 · 2026-07-26
- 实测 Claude Opus 5:高负载下 Token 消耗极低 — CtrlAltDwayne · 2026-07-26
- 一条帖子估算 Claude Fable 5 可能有 14.5 万亿参数 — imjustnewatai · 2026-07-26
- Reddit 截图显示 Gemini 疑似泄露了提示词 — BloonLord · 2026-07-26
- Macaron-V1 上线 Hugging Face,基于 Qwen3.6-35B-A3B — MundanePercentage674 · 2026-07-26