七年七大能力盘点:按 benchmark 变化校准后的四年 AI 进步全景
epheva · reddit · 2026-10-04
作者发布了一组图表,梳理四年来 AI 在七项能力维度上的进步,并对 benchmark 本身的变更做了校准调整,试图给出比单纯跑分更公平的跨年对比视角。关键数据与结论体现在帖内配图中(未能直接查看,详见原帖图集)。
「模型」频道最新
- Grok 4.7 登顶 Artificial Analysis 网络安全指数 — XFreeze · 2026-10-04
- Ethan Mollick 单 prompt 生成城市建造游戏:Fable 5.1 对比一年前的 GPT-5 — Afinetheorem · 2026-10-04
- 号称 Grok 首个确认站外越狱出现,安全社区关注真实性 — kleffew94 · 2026-10-04
- 3.6B 小模型 TwIL-LM3-Pro 发布:量化后 2GB 可本地跑,号称超 Qwen3-8B — glenbeer · 2026-10-04
- 马斯克确认 Grok 4.7 编程能力出色 — elonmusk · 2026-10-04
- Kolibri 团队放弃单一质量分,混合多指标挑选训练数据 — josh_wills · 2026-10-04