将「下一词预测」泛化为「下一联合预测」:张量网络打破动作空间瓶颈
kalomaze · x · 2026-08-12
开发者 @kalomaze 提出可以将大语言模型的「下一词预测」机制泛化为「下一联合预测」。
- 核心观点:无需依赖扩散模型、MSE 回归或流匹配,只要将特定的参数化条件建立在足够丰富的 Transformer 隐藏状态上,就能在组合爆炸的空间中优化出完全有效的联合分布。
- 技术潜力:这为远超目前预期的超大动作空间提供了一条实现精确似然计算与策略梯度的路径,主要受限于秩瓶颈(rank bottleneck)。
- 理论支撑:其引用了 2017 年关于矩阵乘积态(MPS,一种源自量子物理的张量网络)的无监督生成建模论文,探讨其在机器学习生成任务中的能力。
所属事件:张量列分解突破扩散模型局限实现高维精确建模(4 条相关)→
「研究」频道最新
- 单部手机视频即可重建3D人体运动,开源工具OpenCap Monocular发布 — rsasaki0109 · 2026-08-12
- 新研究提出幂律图注意力机制,替代传统点积注意力 — FromtheskyResearchLabs · 2026-08-12
- Terminal-Bench 3.0 榜单更迭:评测模型与 Agent 系统的综合能力 — teortaxesTex · 2026-08-12
- 表格数据生成遇瓶颈?研究指概率电路优于扩散模型 — tetraduzione · 2026-08-12
- 把视频塞进神经网络:790k参数记住27亿像素 — thisdudelikesAI · 2026-08-12
- 新论文提出物体共现框架,用 LLM 嵌入解释大脑语义表征 — TimKietzmann · 2026-08-12