GSO 榜主:榜单已接近饱和,任何基准约 5% 任务本身有问题
scaling01 · x · 2026-09-29
- GSO 榜单作者 slimshetty 更新称,榜单已接近饱和(saturation),很难再区分前沿模型。
- 他同时给出一个基准方法论判断:任何 benchmark(包括他自己做的)里,预计至少约 5% 的任务本身存在质量问题。
- 这是对评测体系局限性的第一手坦承,对解读各类跑分榜有参考价值。
「研究」频道最新
- 470万条解释实验:只审计5%的token位置即可发现prompt注入威胁 — aisilab · 2026-09-30
- 南洋理工 PerF:像素空间扩散DiT按特征分层精炼,FID低至1.63 — NanyangTechnologicalUniversity · 2026-09-30
- IBM提出Q&D训练法:智能体主动追问所需信息,胜过15倍大模型 — ibm · 2026-09-30
- 研究者预测:AI 将速通数学猜想,转向材料与药物发现 — tak3sh8 · 2026-09-30
- Stephen Wright 等三套机器学习优化公开课视频上线,覆盖大步长与隐式偏差 — caglar_ee · 2026-09-30
- 开源框架 Arbor 让 AI agent 自主长期科研,无需人类逐步监督 — burkov · 2026-09-30