把 LLM 词表投影换成小动作头,还能叫 Jev 结构吗
Adamlags · x · 2026-09-20
有开发者提出一个架构问题:LLM 前向传播后通常输出全词表 logits 再自回归解码,若把输出空间限制到预定义动作集合、直接返回动作概率,甚至用一个小输出头替代完整词表投影,是否等于把普通 LLM 变成「一次前向、输出决策分布」的类 Jev 结构?由此追问 Jev 结构真正的新意何在。rasbt 回应称这本质上是经典 encoder 式分类器。
所属事件:rasbt:限制输出为动作空间本质是经典 encoder 分类器(2 条相关)→
「研究」频道最新
- 伯克利教授 Malik 谈 3D 重建:机器人浪费了 3D 结构信号,也别忘了人类研究者的功劳 — JitendraMalikCV · 2026-09-21
- 「深度学习是暴力加广撒网」:权重分布式存储无法编码认知几何 — ryunuck · 2026-09-21
- WFM 论文:用「LLM Wiki」替代稀疏知识图谱做 agent 长期记忆,训练快 10.5 倍 — maier_ak · 2026-09-21
- AI 提前一年预测癌症:Oncoformer 全癌种 AUROC 达 0.869 — EricTopol · 2026-09-21
- 用 LLM 替代高斯过程做贝叶斯优化,博主实测四种方案 — tak3sh8 · 2026-09-21
- 微软研究发现:安全训练可顺带提升小模型隐私保护 — EchoShao8899 · 2026-09-20