开发者自建 CUDA/Rust 推理栈,目标把 65 美元/十亿 token 的模型跑更快
idanbeck · x · 2026-09-18
- 开发者 idanbeck 表示正在把一个定价约 $65/1B tokens 的模型移植到 CUDA + Rust,并从零搭建/优化推理栈,目标是测出推理速度上限。
- 属于社区层面的推理工程实践,值得期待后续基准数据。
「Infra」频道最新
- Ai2 与 NSF、NVIDIA 投入 1.52 亿美元建设全开放 AI 算力基础设施上线 — allen_ai · 2026-09-18
- NVIDIA BioNeMo 推理运行时提速 2.9 倍:Boltz-2 折叠吞吐达 58.5K 残基/GPU 时 — PyTorch · 2026-09-18
- Epoch AI 贸易数据实锤:逾 30 亿美元芯片经马来西亚流入中国 — Jsevillamol · 2026-09-18
- 单卡 3090 跑 Qwen 3 8B + DeepSeek harness,作者直呼体验质变 — tlpta · 2026-09-18
- Creative Strategies 看多 Credo:掌控铜缆与光学全栈设计是关键 — BenBajarin · 2026-09-18
- 前开发者加入 Gimlet Labs,打造用混合芯片的异构推理系统 — snowclipsed · 2026-09-18