Kimi K3 预训练能力被重新校准
RyanGreenblatt · x · 2026-07-17
作者分享了自己对 Kimi K3 pretrain 的快速测试结论,随后又修正了之前的判断。
要点是:
- 最初他把 Kimi K3 的预训练能力估在接近 Opus 4.8、甚至略高的区间;
- 重新测试后,他认为这个判断太乐观;
- 新结论是:Kimi K3 的 pretrain 大致介于 Opus 4 和 Opus 4.5 之间,约落后 Anthropic 8 到 10 个月;
- 同时他也提醒,这类测试更擅长衡量通用预训练能力,未必完全反映代码数据质量。
整体是一次比较克制的模型能力修正,而不是单纯刷榜。
所属事件:Kimi K3 引爆中国前沿模型再评估(94 条相关)→
「模型」频道最新
- 传 OpenAI 在 Astra 中使用 neuralese 循环变换器,新的 scaling 轴浮出水面 — imadade · 2026-09-03
- XBOW 团队拿下今年首个 Chrome 全链漏洞利用奖励 — moyix · 2026-09-03
- Gemini 3.8 Flash 的 Pareto 最优地位仅维持了 5 小时 18 分钟 — alejandroll10 · 2026-09-03
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Anthropic 商务智能体只建购物车交人工结账,被赞退款风控思路对 — HaktanSuren · 2026-09-03
- Qwen3.8 27B Q8 翻车:12 万 token 后发现根本没读计划,自行实现别的功能 — KingCpzombie · 2026-09-03