4.21亿参数判别式模型 Laya 爆红,快 7 倍但复杂任务惨败

maier_ak · x · 2026-09-28

印度一位独立开发者 9 月 18 日发布的 Laya 是一个 4.21 亿参数的 Apache 2.0 开源模型:输入一段文本和一组类型化问题,单次前向传播即输出带概率的答案,一天内在 Hacker News 收获 1200+ 分和约 300 条评论。它是响应旧金山公司 TypeSafe AI 的产品 Jev——后者 9 月 16 日结束两年隐身模式发布,融资 4000 万美元,CEO Diogo Almeida 是 InstructGPT 论文合著者,产品概念是「System One 模型」,用 choice/score/noul 三种原语对任意状态(邮件、工单、JSON)打分。

作者 Andreas Maier 的核心论点是:这本质上是判别式模型(分类器)的回潮——对大量生产问题,一个极快的分类器恰恰就是需要的。但基准数据揭示了边界:Laya 在 AG News 上达到 0.950 且速度约快 7 倍,可在 77 类的 Banking77 上惨败(0.425 对比 0.870),其模型卡也承认基础 checkpoint 零样本时低于多数类基线。结论是「写东西的模型」统治话语三年后,快而窄的判别式路线正在部分场景重新夺回性价比。

所属事件:421M 开源判别式模型 Laya 走红,快 7 倍但复杂任务落败(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →