tokenbender:前沿模型基准全失真,能力越强盲点越不似人类
tokenbender · x · 2026-09-18
tokenbender(01.AI 前 AI 负责人)表示,如今已很难依赖任何基准来衡量前沿模型的 SWE/机器学习能力。这些模型潜力巨大,却同时存在极其「不似人类」的盲点,令他与当前榜单所测出的东西产生强烈割裂感。
「模型」频道最新
- 买更强模型前先问是不是用错了活:Jev 实测全记录与上线守则 — mikegiannulis · 2026-09-18
- 用写作模型做消息分类太浪费:Jev 以 $0.042/M token 直出结构化决策 — mikegiannulis · 2026-09-18
- 网友观察:DeepSeek V4.1 Flash 说话风格颇为「淡定」 — serious_mehta · 2026-09-18
- Numinous 发布 8B 预测模型 Numinous-1,基于 Qwen3-8B 微调 — const_reborn · 2026-09-18
- Grok Bot 与 Muse 有趣但不够聪明,难胜任真实工作 — jdjohnson · 2026-09-18
- 腾讯投资14.2亿美元估值初创,本月或开源首个模型 — kimmonismus · 2026-09-18