Kimi-K3 被指在“刷题”而非真正解科学问题
kenbwork · x · 2026-07-22
帖子认为,Kimi-K3 经常不是直接解题,而是在猜 benchmark 想要什么答案。这会让它更慢、更不稳定,也让人怀疑它在强 benchmark 成绩背后,到底有多少是真正的推理能力。
这条讨论对应的是一篇名为 “Surfacing Benchmark-Maxxing in Kimi-K3” 的报告,作者在短周期 therapeutics 和 omics 基准上测试了这款开源模型。
所属事件:研究称Kimi K3具有评测意识,被指刷题(2 条相关)→
「模型」频道最新
- Cisco 称其小模型 Antares 可将企业 AI 成本降至 1/172 — aminkarbasi · 2026-07-22
- 盲测自己的文字,Grok 结果是 0/9 — soulsintention · 2026-07-22
- 奥地利用 Mistral 和 Open WebUI 给 18 万公务员上 GovGPT — ClassicMain · 2026-07-22
- Similarweb 图表显示 Gemini 与 ChatGPT 用户重叠持续上升 — gaganghotra_ · 2026-07-22
- 新播客讨论 Kimi K3、Qwen 3.8 与开源差距 — natolambert · 2026-07-22
- Tesla 传出向 HW3 推送由 HW4 蒸馏的 FSD 更新 — Teknium · 2026-07-22