ForkUnion v3 发布:NUMA 感知线程池延迟降 3-6 倍
viglovikov · x · 2026-08-21
开发者发布 ForkUnion v3,这是一个适用于 C/C++/Rust/Zig 的低延迟 NUMA 感知线程池。
- 性能提升:在 Nebius 的 fat NUMA 机器上测试,相比 OpenMP 延迟降低 3-6 倍,相比 Taskflow 和 Rayon 降低 12-16 倍。
- 设计理念:避免了堆分配、互斥锁和 CAS 原子操作在热路径上的调度开销,解决跨 100+ 核心(如 NVIDIA DGX 和 Arm Vera 机架)扩展时的瓶颈。
- 应用场景:已用于 USearch 的向量搜索、NumKong 的 LLM KV-cache/attention 内核以及 StringZilla 的生物信息学工作负载。
「Infra」频道最新
- 算力账本:宣称日处理 100T token 需要约 58 万张 GPU? — teortaxesTex · 2026-08-21
- 摩尔定律失效在即,非硅计算与新型架构将迎资本热潮 — MikePFrank · 2026-08-21
- 「不懂为什么要建数据中心,写快点内核不就行了」 — basedjensen · 2026-08-21
- 康奈尔新架构降低 36% 训练算力 — burkov · 2026-08-21
- 腾讯发布 FlashPrefill V2:长上下文推理加速方案 — tencent · 2026-08-21
- SGLang 作者征集用户痛点,承诺针对性改进 — BanghuaZ · 2026-08-21