新基准测试 Transformer 在复杂度上的泛化极限
jasondeanlee · x · 2026-08-04
这条讨论的是一类更接近“physics of LMs”的 benchmark:用来测试不同架构的极限,以及目标函数和优化器是否需要协同设计。
链接论文 《Adaptivity and Modularity for Efficient Generalization Over Task Complexity》(arXiv:2310.08866)研究的是 Transformer 能否在复杂度不同的任务上泛化。作者构造了基于 pointer value retrieval 的新任务,结果显示:标准 Transformer 在需要更多顺序计算步数时会遇到明显困难。
论文提出的 Hyper-UT 把两种机制结合起来:
- 通过 hypernetwork 做动态函数生成
- 通过 Universal Transformer 引入自适应深度
摘要声称,这种组合能在高复杂度样本上取得更高准确率,也能让计算资源分配更公平;作者还表示,这一思路不仅适用于玩具任务,也能迁移到常规图像识别场景。
「研究」频道最新
- 伯克利论文用 CLIFT 将 Gemini 机器人变成人形专家 — berkeley_ai · 2026-08-04
- LLM 评测研究显示,提示词微调就能翻转排行榜 — jindong_wang92 · 2026-08-04
- 每个 Agent 都需要的电脑与浏览器验证技能 — vikvang1 · 2026-08-04
- 密歇根大学实验室招 5 个 AI、ECG 与多组学岗位 — kevinnbass · 2026-08-04
- scE2G 预测已覆盖数百种细胞类型可在线浏览 — anshulkundaje · 2026-08-04
- scE2G 登上 Nature Genetics 并补充 CRISPR 基准 — anshulkundaje · 2026-08-04