Kimi k3 很强,但跑分不能证明真实能力
FuSheng_0306 · x · 2026-07-24
Kimi k3 的确很强,但作者认为跑分不能全信,尤其在长任务上,榜单成绩和真实体验可能差很多。
- 这条帖子的核心是:别把 benchmark 当唯一依据,实际多用几轮更重要。
- 作者顺带拿 Meta 的 Llama 4 举例,认为它说明了“分数好看 ≠ 上线后就稳”。
- 帖子里还夹带了对 Meta 团队内部和基准测试的未经证实说法,这部分应谨慎看待。
「公司和人」频道最新
- 谷歌被指在 Gemini 3.0 Pro 后丢掉领先优势 — haider1 · 2026-07-24
- Moonshot 的 Kimi K3 展示开源模型如何借外部算力取胜 — scientificamerican · 2026-07-24
- Legora 的法律推理基准让生产输出质量提升 5% — chetanp · 2026-07-24
- Palantir 称两天冒出 3 个新产品,强调前线快速交付 — BrettKrieger12 · 2026-07-24
- 独立开发者与 AI 辅助开发正成新类别 — YvesMulkers · 2026-07-24
- 纳德拉力挺开权重模型,称其关乎美国 AI 领导力 — satyanadella · 2026-07-24