421M 开源判别式模型 Laya 走红,快 7 倍但复杂任务落败
独立开发者于 9 月 18 日发布开源模型 Laya(421M 参数,Apache 2.0),在 Hacker News 上一天收获 1200+ 分和约 30 万浏览。该模型回归判别式范式:输入文本与类型化问题,单次前向传播直接输出带概率的答案,完全不生成文本,在单张 T4 上延迟约 40 毫秒。作者同时发布博客《Laya, Jev and the Return of the Discriminative Model》,探讨这一小型判别式路线的回归,并将其与闭源产品 Jev(来自 TypeSafe AI)作对比。
已确认
- Laya 为 421M 参数、Apache 2.0 许可的开源模型,单次前向返回带概率答案,T4 上约 40ms,不生成文本。
- 作者实测:AG News 上准确率 0.950,速度约快 7 倍;77 类的 Banking77 上仅 0.425,基线为 0.870。
- 模型卡承认其基础 checkpoint 在零样本情况下表现低于多数基线。
- 作者发布配套博客,主张判别式小模型路线正在回归,并对比闭源的 Jev。
为什么重要
- 在生成式 LLM 主导的当下,Laya 展示了不生成文本、直接输出概率答案的小模型路线在延迟与成本上的潜力。
- 但多标签/多类别任务上的大幅落后表明该路线的适用边界明显,基础 checkpoint 的零样本弱点是主要短板,作者本人也在模型卡中坦承。
2026-09-28 ~ 2026-09-28 · 5 条相关
一手来源
- 421M开源模型Laya单次前向返回答案概率,T4延迟仅40毫秒 — maier_ak ·
- 新模型 Laya 快 7 倍但多标签任务惨败于基线 — maier_ak ·
- 4.21亿参数判别式模型 Laya 爆红,快 7 倍但复杂任务惨败 — maier_ak ·
- Laya 与 Jev:判别式模型正在回归的小模型路线 — maier_ak · 2026-09-28
- 【源头】421M开源模型Laya单次前向返回答案概率,T4延迟仅40毫秒 — maier_ak · 2026-09-28
- 421M 参数开源模型 Laya 单次前向输出概率答案,单卡 40ms — maier_ak · 2026-09-28
- 【源头】4.21亿参数判别式模型 Laya 爆红,快 7 倍但复杂任务惨败 — maier_ak · 2026-09-28
- 【源头】新模型 Laya 快 7 倍但多标签任务惨败于基线 — maier_ak · 2026-09-28