零成本预测可训练性:一次前向传播挑出更优超参,快 3.4 倍
Bulky-Pack8781 · reddit · 2026-09-08
Reddit 帖讨论一项「训练前预测可训练性」(precog-trainability)研究:能否在正式训练前,仅凭未训练网络的一次前向/反向传播判断某组超参/初始化是否值得投入算力。
- 案例一:3 个初始化中 2 个完全不收敛,该方法精准选中唯一收敛者,627 步收敛(对比 1600+ 步)
- 案例二:选出的配置 61 步完成,最差选择需 208 步,约 3.4 倍提速,决策耗时毫秒级且无需 GPU
- 整体表现有限:三选一最佳配置的 top-1 准确率 47%(随机为 33%)
- 方法存在可证明的盲区:因尺度不变性问题,它永远无法推荐某个初始化,即使后者实际最快;作者尝试三种修复均未整体改善,并主动撤回过一个相关性结论
- 实验均为合成任务,能否推广到 LoRA rank 等真实微调场景仍是开放问题
- 论文与代码:rustnew.github.io/precog-trainability
「研究」频道最新
- 开发者开源语音 AI 基准聚合站:TTS/STT/LLM 基准一站查 — alexcovo_eth · 2026-09-08
- 研究员微调果蝇神经模型:让它听到音调就摆 Y-M-C-A 造型 — emax · 2026-09-08
- 任务感知量化 TAK:27B 模型以 15% 体积达到 BF16 99% 推理性能 — devildip · 2026-09-08
- AI 改造果蝇神经回路致其绝育,动物保护组织愤怒抗议 — Polymarket · 2026-09-08
- ECCV 教程聚焦世界模型评测,StEvo 团队分享新发现 — georgiagkioxari · 2026-09-08
- 研究:蒸馏 SKILL.md 比工作流记忆高 6.06 分,技能靠稳定执行起效 — rohanpaul_ai · 2026-09-08