TensorFold 1.0.5 发布:19.8k 长对话续轮预填充从 8.1 秒降到 0.16 秒
HankYeomans · x · 2026-10-11
本地大模型推理工具 TensorFold 发布 1.0.5 版本,核心更新是跨请求保留对话的 prompt 状态:后续轮次只预填充新增 token。
- Nemotron 3.5 Lightning:在 Metal 与 CUDA 上缓存对话 prompt 状态,19.8k token 对话第二轮预填充仅 0.16 秒(此前 8.1 秒);M5 Max 上 7k token 对话后续轮首 token 延迟从 1.6-2.1 秒降到 0.02-0.17 秒
- GLM-5.3-Flash 可在单台 256 GB M5 Ultra 上运行
- 编辑/删除/重新生成最后一轮时,也能从缓存状态恢复,M3 Ultra 上 9k token 对话的多次操作合计 prompt 处理 1.7 秒(此前 10.9 秒)
- 可用 --prompt-cache-gib 控制缓存大小,设 0 关闭;另修复 27B 模型在 macOS 27 上的问题
安装:brew upgrade tensorfold。作者预告下一版将加入 Living Weights 功能。
「Infra」频道最新
- AirLLM 逐层推理:4GB 显存跑 70B 模型,8GB 可上 405B — JensHonack · 2026-10-11
- 让模型「原地重复」:权重循环复用把语音模型压缩 13 倍 — pbaylies · 2026-10-11
- 推理需求一年暴涨,在后训练/RL 增长曲线上却近乎平线 — zainhas · 2026-10-11
- Pat Gelsinger 炮轰 HBM:每位数据耗四倍内存的「糟糕存储器」 — SumitGup · 2026-10-11
- 高通 CEO 预言 AI 手机超级周期:眼镜将成最大 AI 穿戴品类 — SuB8u · 2026-10-11
- 用 WebAssembly+Spin 部署 MCP 服务器:60 秒全球上线、零冷启动 — AI Engineer · 2026-10-11