研究者质疑缩放实验:架构同质化、选择题评测易被刷分
burny_tech · x · 2026-09-09
Elie Bakouch 对 @dwarkeshsp 的缩放实验结论提出两点技术质疑:
- 实验所用架构高度同质:全部是 dense full-attention transformer,仅有 swiglu、qk norm、rope 值等微调,没有纳入 MoE 等重要变量,因此「架构不重要」的结论适用范围有限。
- 评测方式存疑:使用多选题 QA 而非补全/困惑度类评测,而多选题形式极易被混入 QA 数据刷分,更新的数据集已在过滤这类数据。
他仍认可实验的价值,并呼吁公开 checkpoint,方便社区做不同评测或研究模型内部机制。
「研究」频道最新
- 预注册研究:写作能力与 CS 功底都能预测 vibe coding 水平 — dair_ai · 2026-09-09
- AI 玩高等数学还陷入学术优先权之争,网友:RL 学术界学过头了 — anshulkundaje · 2026-09-09
- 开发者用 Claude 可视化 OpenAI 的欧拉方程有限时间爆破构造 — CatAstro_Piyush · 2026-09-09
- SimpleMemVLA:用完整视频历史喂VLM实现长程机械臂操作 — openbmb · 2026-09-09
- Elicit 建模估计:住室内外平均折寿约 2 年 — elicitorg · 2026-09-09
- Latent Craft 发布:浏览器里飞越 108 万张 19 世纪公版图像 — leland_mcinnes · 2026-09-09