自适应深度停机规则负结果:损失更差、选的深度反而更多
BlackHC · x · 2026-10-06
作者报告一个负面结果:在变深训练与修复后,用状态余弦相似度作为停机规则做自适应深度。固定深度 4 的损失为 3.3761;而自适应停机平均选择 4.75 次传递,损失 3.3816——损失更差、选择的深度还更多。作者提醒这并非实测 FLOPs 节省。
所属事件:前DeepMind研究员发布共享核心KV cache的绑定Transformer(8 条相关)→
「研究」频道最新
- 华为诺亚提出 Tail-Influence Sampling:策略评估 CVaR 估计误差最高降 76% — huawei-noah · 2026-10-06
- Google 发布 KeyRec:仅用 10% 视觉 token 预算搞定长视频与流式理解 — google · 2026-10-06
- 4DCodeBench 基准:前沿模型能重建静态场景却搞不定动态物理 — 4DCodeBench · 2026-10-06
- OmniTask 论文:生成数据训练确能提升理解任务表现 — WeijiaShi2 · 2026-10-06
- 牛顿证乘积法则不用极限:离散对称差分让高阶项神奇消失 — ctjlewis · 2026-10-06
- DeepMind 从零设计酶:一酶产药靶分子效率高 99 倍,一酶 90°C 降解塑料 — 141_1337 · 2026-10-06