单人单卡训练 421M 决策模型 Laya 开源,35ms 单次前向出结果
Nandakishor_ml · reddit · 2026-09-18
Reddit 用户 Nandakishorml 发布开源决策模型 Laya(此前「自建 Jev 架构」的通用版),在一块 RTX 6000 Pro(96GB 显存)上完成训练。
- 架构:421M 参数的非自回归决策模型,双向 ModernBERT-large 编码器 + 从零训练的 Transformer 头,对 [MASK] 选项标记打分,单次约 35ms 前向即可解析带类型的 schema。
- 数据:超过 25,000 条全人工标注的真实样本,覆盖意图路由、事实核查、审核共识、prompt 护栏、rubric 评分与多轮对话轨迹,无合成数据捷径。
- 训练方法:采用(非官方)RLCD——一种策略梯度强化学习,用严格 proper scoring rules 优化决策模型,确保只有输出真实且数学上校准的概率时才获得最大奖励。
作者放出了 HF Space 在线 demo、GitHub 仓库与 HF 权重,称其超越了此前所有 Jev 基准,同时坦承模型仍需打磨。
「研究」频道最新
- 李飞飞:5.4 亿年视觉演化驱动了智能的诞生 — rohanpaul_ai · 2026-09-18
- 学者吐槽顶会禁改论文标题,呼吁改变学术论文接受后文化 — tianyin_xu · 2026-09-18
- 《视觉通用智能》白皮书作者将做客 Video Model Journal Club 深度解读 — HirokatuKataoka · 2026-09-18
- KV cache 最易被误解的一点:token 可以先生成,后进缓存 — techNmak · 2026-09-18
- 神操作:让模型输出 ASCII,非文本生成器秒变自回归 LLM — multiply_matrix · 2026-09-18
- 新论文声称 8.1 Mbps 吞吐,作者称仍有重大物理障碍 — BlancheMinerva · 2026-09-18