LLM 有参数下限或上限吗?小模型为何总在「勉强维持」
Zeeplankton · reddit · 2026-09-22
Reddit 上关于模型规模的讨论:是否存在「最低可用参数量」才够支撑连贯智能?反过来,参数是否可以无限扩展?做一个 5T+ 参数以上的模型还有收益,还是反而成为负担?
发帖人举例:Qwen 3.8 27B 这类模型很强但仍偏大,且感觉「为代码特化过头」,不适合派其他任务;更小的模型能用的勉强能用,但能明显感觉到它们在艰难维持整体一致性。
「模型」频道最新
- DFlash2 搭配 GLM 5.3 Flash 处理超长 prompt 会出问题 — TheZachMueller · 2026-09-22
- 「MiMo 首创大规模 MOPD」:圈内热议 MiMo-V2.6 向 DeepSeek 叫板 — teortaxesTex · 2026-09-22
- 数字母测试翻车不冤:Jev 逐字母输入 strawberry 时 168/168 全对 — BLUECOW009 · 2026-09-22
- 博主自纠:落地 SF 发现真正惊喜是 MiMo-2.6,胜过 Grok 4.7 且更便宜 — kimmonismus · 2026-09-22
- InstructGPT 作者 Diogo Almeida 谈 Jev:为软件而非聊天造模型 — Latent Space · 2026-09-22
- DataBench 新图表流出,疑似 OpenAI 内部模型 luna 曝光 — almmaasoglu · 2026-09-22