tinygrad 之痛:Kimi K3 代码常优于 GPT-6 Astra,但基准测不出

mohbibi_ · x · 2026-09-22

tinygrad 作者 George Hotz 发推称现有基准测试有缺失:Kimi K3 写的代码常常比 GPT-6 Astra 更好——它不写无用的冗长测试,也不给令人困惑的解释。他认为要成为优秀的软件工程师必须善于沟通,而这恰恰是 RL 训练捕捉不到的能力。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →