MoE 实验里 prompt 数量会影响结果
eliebakouch · x · 2026-07-18
这条回复在讲一组关于 **jspace** 的实验细节: - 对更大的 MoE 模型,作者提到还有一定“jspace”空间,但 **fable** 做了较大的近似,只在很少的层上计算。 - 他们在做实验时,会让模型自己决定部分实验设置,但模型并不总是能想到最合理的对照,比如: - 该先在更小模型上验证影响; - 该检查 prompt 数量变化带来的影响。 - 另外,模型下载了 **nvfp4** 的 checkpoint,因为它更快;它也明确承认这种做法可能引入误差。 - 作者还提到:因为模型太大,只能用更少的 prompts 来估计 jspace(250 vs 1000),并给出了此前在 **gemma 3-27B** 上关于 prompt 数量如何影响 jspace 形状的结果。
所属事件:MoE模型实验探讨Prompt数量对Jspace估计的影响(2 条相关)→
「研究」频道最新
- SIGGRAPH 论文展示点云场景的快速 signed distance 计算 — keenanisalive · 2026-07-21
- Andrew Ng 发布 1 小时课程,讲 agentic knowledge graphs 与 Google ADK — blaizedsouza · 2026-07-21
- 南加州大学提出 TOPL:逐 token 离策略学习泛化到 11 个摘要集 — UniversityofSouthernCalifornia · 2026-07-21
- OpenAI 内部模型据称可自主解出单位距离问题,成功率 48% — inductionheads · 2026-07-21
- 从 Jacobian 猜想根部导出的显式反例对象 — kevrussell · 2026-07-21
- 斯坦福研究指向衰老:免疫清除失灵拖累多器官功能 — Dr_Singularity · 2026-07-21