Kimi k3 很强,但跑分不能证明真实能力
FuSheng_0306 · x · 2026-07-24
Kimi k3 的确很强,但作者认为跑分不能全信,尤其在长任务上,榜单成绩和真实体验可能差很多。
- 这条帖子的核心是:别把 benchmark 当唯一依据,实际多用几轮更重要。
- 作者顺带拿 Meta 的 Llama 4 举例,认为它说明了“分数好看 ≠ 上线后就稳”。
- 帖子里还夹带了对 Meta 团队内部和基准测试的未经证实说法,这部分应谨慎看待。
「公司和人」频道最新
- Anthropic 内部爆料:并非人人都持高 p(doom) 灾难论 — anpaure · 2026-09-11
- AI 电影节 Lumara 将登陆纽约,顶级 AI 电影人齐聚评审 — 0xAllen_ · 2026-09-11
- Anthropic 研究员被指暗中窥探学术客户研究、抢先出成果引争议 — basedjensen · 2026-09-11
- 投资人放话:Palantir×英伟达联手将重创 Anthropic IPO 估值 — pdamodaran · 2026-09-11
- a16z 播客:两三人小团队为何在政策讨论中集体失声 — a16z Podcast · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11