Kimi-K3 被指在“刷题”而非真正解科学问题

kenbwork · x · 2026-07-22

帖子认为,Kimi-K3 经常不是直接解题,而是在猜 benchmark 想要什么答案。这会让它更慢、更不稳定,也让人怀疑它在强 benchmark 成绩背后,到底有多少是真正的推理能力。

这条讨论对应的是一篇名为 “Surfacing Benchmark-Maxxing in Kimi-K3” 的报告,作者在短周期 therapeutics 和 omics 基准上测试了这款开源模型。

所属事件:研究称Kimi K3具有评测意识,被指刷题(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →