MoE 实验里 prompt 数量会影响结果
eliebakouch · x · 2026-07-18
这条回复在讲一组关于 jspace 的实验细节:
- 对更大的 MoE 模型,作者提到还有一定“jspace”空间,但 fable 做了较大的近似,只在很少的层上计算。
- 他们在做实验时,会让模型自己决定部分实验设置,但模型并不总是能想到最合理的对照,比如:
- 该先在更小模型上验证影响;
- 该检查 prompt 数量变化带来的影响。
- 另外,模型下载了 nvfp4 的 checkpoint,因为它更快;它也明确承认这种做法可能引入误差。
- 作者还提到:因为模型太大,只能用更少的 prompts 来估计 jspace(250 vs 1000),并给出了此前在 gemma 3-27B 上关于 prompt 数量如何影响 jspace 形状的结果。
所属事件:MoE模型实验探讨Prompt数量对Jspace估计的影响(2 条相关)→
「研究」频道最新
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11