4.21亿参数判别式模型 Laya 爆红,快 7 倍但复杂任务惨败
maier_ak · x · 2026-09-28
印度一位独立开发者 9 月 18 日发布的 Laya 是一个 4.21 亿参数的 Apache 2.0 开源模型:输入一段文本和一组类型化问题,单次前向传播即输出带概率的答案,一天内在 Hacker News 收获 1200+ 分和约 300 条评论。它是响应旧金山公司 TypeSafe AI 的产品 Jev——后者 9 月 16 日结束两年隐身模式发布,融资 4000 万美元,CEO Diogo Almeida 是 InstructGPT 论文合著者,产品概念是「System One 模型」,用 choice/score/noul 三种原语对任意状态(邮件、工单、JSON)打分。
作者 Andreas Maier 的核心论点是:这本质上是判别式模型(分类器)的回潮——对大量生产问题,一个极快的分类器恰恰就是需要的。但基准数据揭示了边界:Laya 在 AG News 上达到 0.950 且速度约快 7 倍,可在 77 类的 Banking77 上惨败(0.425 对比 0.870),其模型卡也承认基础 checkpoint 零样本时低于多数类基线。结论是「写东西的模型」统治话语三年后,快而窄的判别式路线正在部分场景重新夺回性价比。
所属事件:421M 开源判别式模型 Laya 走红,快 7 倍但复杂任务落败(5 条相关)→
「研究」频道最新
- 2170 个开源项目实证:Jev 决策模型生态快速扩张但关注错位 — CUHK-CSE · 2026-09-28
- 首尔大学提出 FoMo:用扩散轨迹分叉点自动度量图像感知距离 — SeoulNatlUniv · 2026-09-28
- CARD 框架:聚类 LoRA + 奖励引导解码实现可扩展 LLM 个性化 — Yutong Song · 2026-09-28
- 研究发现显式风格指令会摧毁 LLM 个性化,提出轻量插件 PsPLUG — Yutong Song · 2026-09-28
- CMU TrackEverything:40GB 显存内追踪超千帧视频全部可见点 — CarnegieMellonU · 2026-09-28
- 阿里系团队开源 ZooWork-ShopRanker:LLM 评审对齐的电商重排器 — _reachsumit · 2026-09-28