能量Transformer论文:纯无监督学会System 2思考,训练缩放率高35%
rbhar90 · x · 2026-09-06
arXiv 论文《Energy-Based Transformers are Scalable Learners and Thinkers》提出一类新模型 EBT(Energy-Based Transformers),试图回答:能否只靠无监督预训练就让模型学会「System 2 式思考」?
- 核心思路:训练模型为每个「输入-候选预测」对分配能量值,把预测问题重构为通过梯度下降对能量最小化的优化过程,直到收敛。
- 与现有推理时计算方法(verifier、可验证奖励等)不同,EBT 不需要额外监督、不限于文本或数学/代码等可验证领域,可跨模态泛化。
- 实验结果:在离散(文本)与连续(视觉)模态上,EBT 相比主流 Transformer++ 训练时缩放更快,在数据量、batch size、参数量、FLOPs、深度等维度最高达 35% 的缩放率提升。
「研究」频道最新
- AdaptVPR 用路由感知难正样本合成,提升视觉地点识别鲁棒性 — Shunpeng Chen · 2026-09-07
- SC Asia 2027 征稿启动:聚焦超算、AI 基础设施与量子,2027 年 3 月新加坡举办 — thoefler · 2026-09-07
- 前沿模型不止是产品:内部充当小模型 RL 教师放大整家族收益 — haider1 · 2026-09-07
- 前 Google Brain 研究员:塑造前沿的算法突破大多在 1e20 FLOPs 内发现 — _arohan_ · 2026-09-07
- GlossoGen 论文:LLM 智能体间涌现出人类无法理解的新语言 — abenitezburraco · 2026-09-07
- arXiv 论文攻克在线公平分配三大开放问题,证明多重不可能性 — chaumian · 2026-09-07