开源 .hk 张量格式:比 safetensors 快 1.72 倍,873M 参数 15ms 加载
blackwing2008 · reddit · 2026-09-14
开发者 blackwing2008 发布了 HK,一个统一的神经网络张量框架与二进制容器格式(.hk),定位为 SafeTensors/GGUF 的更快、硬件对齐替代方案,核心用 Zig 原生实现。
核心设计
- 双模式权重重建:4-bit 查表量化(16 条目 + 块缩放)另存残差误差流;Mode 1 仅用基础量化权重(6.4× 压缩)做边缘推理,Mode 2 按需流式加载残差流,恢复 >0.99999 余弦相似度的全精度权重。
- 硬件对齐:4096 字节 AMD/Intel + 16KB Apple Silicon + 128 字节 NVIDIA Tensor Core 的 super-coalesced 对齐,单文件跨异构芯片零拷贝运行(基于页缓存 mmap)。
基准(Qwen3.5-0.8B,873M bf16 参数)
- Layer GEMV 快 1.72×(0.21ms vs 0.37ms)
- 热态自回归层检索快 346×(80ns)
- 冷态层检索快 3.72×;模型加载为纯零拷贝 mmap
其他特性:支持 137+ 模型架构双向名称映射(32 万/秒);无损 2:4 结构化稀疏(1.88× 物理压缩、零误差);百 GB 级模型分片存储;微秒级原位元数据编辑(改 tokenizer 配置/聊天模板无需重新序列化);GGUF↔HK↔SafeTensors 无损互转。
「Infra」频道最新
- SK 海力士完成 HBM4 内部认证,HBM 进入定制基底裸片竞争时代 — blaizedsouza · 2026-09-14
- 一个架构改动让 KV 缓存缩小 8 倍:GQA 原理与 Llama 3 实例拆解 — blaizedsouza · 2026-09-14
- HBM 系统架构全景:从 DDR 演化到 GDDR7、PIM 与 HBF 等替代路线 — blaizedsouza · 2026-09-14
- Nvidia 新论文:让 LLM 稀疏化提速,95% 静默神经元可被跳过 — YesThisIsLion · 2026-09-14
- 开源 Tahuna 基础设施,支撑自主 ML 实验循环 Hillclimb — Monaim101 · 2026-09-14
- 马斯克放话:每年送 1000 万吨入轨,太空建太瓦级算力 — elonmusk · 2026-09-14