新基准测试 Transformer 在复杂度上的泛化极限

jasondeanlee · x · 2026-08-04

这条讨论的是一类更接近“physics of LMs”的 benchmark:用来测试不同架构的极限,以及目标函数和优化器是否需要协同设计。

链接论文 《Adaptivity and Modularity for Efficient Generalization Over Task Complexity》(arXiv:2310.08866)研究的是 Transformer 能否在复杂度不同的任务上泛化。作者构造了基于 pointer value retrieval 的新任务,结果显示:标准 Transformer 在需要更多顺序计算步数时会遇到明显困难。

论文提出的 Hyper-UT 把两种机制结合起来:

摘要声称,这种组合能在高复杂度样本上取得更高准确率,也能让计算资源分配更公平;作者还表示,这一思路不仅适用于玩具任务,也能迁移到常规图像识别场景。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →