K3 已能攻克 IMO 题,但仍需更多算力和 RL
teortaxesTex · x · 2026-07-21
引用帖在讨论 K3 的能力上限:它已经能在 IMO 级别任务上“做对”,但还会消耗很多 token。
作者进一步判断:如果先排除网络和计费这类无关故障,并把吞吐提升到 80 tps,整体表现会接近 5.6 Sol 的两倍以内。结论是:还需要更多算力和 RL,但已经很接近了。
「模型」频道最新
- Google DeepMind 发布 Gemini 3.5 Flash Cyber 安全模型 — ralucaadapopa · 2026-07-22
- Poolside 的 Laguna S 2.1 在 Nous Portal 免费开放两周 — NousResearch · 2026-07-22
- Qwen3.8 Max Preview 横评后被认为明显进步 — curiousily_ · 2026-07-22
- Moonshot 的 Kimi K3 登上 MathArena 第五名开源最佳 — xeophon · 2026-07-22
- Google 推出 Gemini 3.5 Flash Cyber,限量供政府和可信伙伴使用 — GoogleAI · 2026-07-22
- Gemini 3.5 Flash-Lite 的长上下文检索优于 3.1 — Dillonu · 2026-07-22