tinygrad 之痛:Kimi K3 代码常优于 GPT-6 Astra,但基准测不出
mohbibi_ · x · 2026-09-22
tinygrad 作者 George Hotz 发推称现有基准测试有缺失:Kimi K3 写的代码常常比 GPT-6 Astra 更好——它不写无用的冗长测试,也不给令人困惑的解释。他认为要成为优秀的软件工程师必须善于沟通,而这恰恰是 RL 训练捕捉不到的能力。
「编程与Agent」频道最新
- Agora 论文:13 个 AI 研究员用 Git 共享记忆协作 12 天 — suchenzang · 2026-09-22
- Grok 4.7 发布,PSAISuite 零改动直接兼容新模型 — dfinke · 2026-09-22
- Mistral 实战:AI 智能体迁移 4 万行 Fortran 77 到 C++ — dl_weekly · 2026-09-22
- 博主用 CREAO Agent 一行输入跑通完整短片生成管线 — socialwithaayan · 2026-09-22
- 内部评测:任务每翻倍一倍,Haiku 完成率近乎减半 — EvalRaccoonDev · 2026-09-22
- 独立开发者上架 Storewake MCP:$19/月查询 App Store 排名与收入 — Pfernan95 · 2026-09-22