零重训改造冻结 LLM:向浅层泄漏深层残差向量解状态追踪难题
burny_tech · x · 2026-09-18
作者提出一个研究思路线程:Transformer 在状态追踪任务上失败,根源在于电路深度(circuit depth)有上限。其设想的解法是把冻结的 LLM 视为一个动力系统——在下一步推理时,把深层残差向量「泄漏」注入早期层,从而突破深度限制,且全程零重训。具体方法与实验结果见原线程链接。
「模型」频道最新
- 腾讯 Hy4 Preview 位列开源模型第四,最便宜且三项 agent 榜第一 — mariofilhoml · 2026-09-18
- 计数字母暴露短板:GPT-6-Astra 93% 对手惨败 — scaling01 · 2026-09-18
- Typesafe 推出 Jev 模型:不做文本生成,直接输出带概率的类型化决策 — majidmanzarpour · 2026-09-18
- 智谱 AI 自主发现可被 WeWorm 利用的安全漏洞,引关注 — teortaxesTex · 2026-09-18
- 用户实测:保险法律问题 Gemini 一遍答对,ChatGPT 循环诡辩 — Hatrct · 2026-09-18
- Typesafe AI 发布分类模型 Jev,成本较同类 LLM 最多降 400 倍 — hwchase17 · 2026-09-18