40万参数实现可靠计算:LLM 离散执行边界实验
kostrubaty · reddit · 2026-08-12
作者探讨了如何通过离散执行边界(Discrete Execution Boundary)构建一个由神经智能体和确定性测试工具(harness)紧密耦合的双运行时系统,以解决大语言模型在计算和状态追踪上的可靠性问题。
通过在 WebGPU 环境中训练微小模型,作者得出了关键结论:
- 语义 Token 优势:密集的规范中间表示(IR)在样本效率上远超普通英文与 BPE,在组合泛化测试中高出约 40 分。
- 深度外推限制:单次前向传播无法外推计算深度,但通过外部调度器增加局部调用次数,可在深度达到 16 时保持 100% 准确率。
- 标识符处理:学习到的嵌入不应作为对象标识符,身份验证必须依赖独立的精确通道。
- 参数规模极小:系统的学习部分(意图编译器)仅需约 12.6 万参数,加上数量指针阶段,整个系统下限仅为 40 万参数。
「研究」频道最新
- 众包训练机器人:浏览器遥测生成 5 万条操作数据 — jiqizhixin · 2026-08-12
- 顶刊高引学者反思:许多高质量预印本几乎无人问津 — mjdramstead · 2026-08-12
- 哈佛与UIUC提出探索式建模:打破端到端生成瓶颈,效率最高提升6倍 — jiqizhixin · 2026-08-12
- 单部手机视频即可重建3D人体运动,开源工具OpenCap Monocular发布 — rsasaki0109 · 2026-08-12
- 新研究提出幂律图注意力机制,替代传统点积注意力 — FromtheskyResearchLabs · 2026-08-12
- Terminal-Bench 3.0 榜单更迭:评测模型与 Agent 系统的综合能力 — teortaxesTex · 2026-08-12