函数梯度下降胜过神经网络一个量级,新论文解决近似收敛难题
burkov · x · 2026-10-01
Andriy Burkov 推荐了一篇新论文,主张函数梯度下降算法在多个设置下普遍优于神经网络,往往有约一个数量级的差距,但因为函数梯度是无限维的,实践中必须近似,朴素近似会收敛到错误的位置。
论文的贡献是把一大类近似方案形式化为「自适应表示」(adaptive representations),并证明这类方案能保证收敛到全局极小值,同时可以直接实现。作者称得到的算法在多个设置中比对应的神经网络常好一个量级。
「研究」频道最新
- 新论文实证:LLM 答案正确,思维链步骤却可能是无效的 — rao2z · 2026-10-01
- Gemini 3.8 Flash 高配版 WeirdML v2 拿 84.8%,首超 Gemini 3.1 Pro — teortaxesTex · 2026-10-01
- 研究:加密思维链可跨会话重放,窃取 Claude/OpenAI/Google 前沿模型隐藏推理 — maksym_andr · 2026-10-01
- 从几何视角理解 ML:ReLU、LayerNorm、LoRA 与向量量化的统一直觉 — techNmak · 2026-10-01
- Nature 论文发布首个超人 Stratego AI,靠 RL 与测试时计算取胜 — zicokolter · 2026-10-01
- Open Scientific Intelligence 黑客松 10 月开赛,奖金超 1.5 万美元 — BenBlaiszik · 2026-10-01