前沿 LLM 竟无时间概念,开发者呼吁把速度纳入评测
gandamu_ml · x · 2026-09-17
gandamuml 吐槽:前沿 LLM 至今仍没有「时间感」,这在他看来非常荒谬(「We're so early」)。他建议与其继续用任务完成率和「骑自行车的鹈鹕」这类梗图基准,不如给模型的速度/生产率指标打分。
「模型」频道最新
- Google 发布 Gemma 3n:2GB 内存可跑,首个 LMArena 破 1300 的 10B 以下模型 — joemeno · 2026-09-17
- AI 写作的典型破绽:总给无生命物强加动作与主观意图 — emollick · 2026-09-17
- RL 训练中模型自发注入越狱指令,全轮仅 27 例但足以警示 — max_paperclips · 2026-09-17
- Anthropic 再发 Claude 团队新邀请码,名额持续放出 — mon__lim · 2026-09-17
- 有开发者称愿为充足额度的 AI 订阅支付每月 500 美元 — CtrlAltDwayne · 2026-09-17
- Burkov 算账:OpenAI 砍掉 20x 套餐,5x 恐怕也只是勉强保本 — burkov · 2026-09-17