Basalt 推理引擎:5090 上跑出 665 tok/s,达 Strata 2.6 倍
jesdga95 · reddit · 2026-10-10
作者发布 Strata 的深度调优分支 Basalt,专为 Qwen3.8 Flash-Next 和 Blackwell 架构(含双卡)设计,MIT 开源,权重同步上架 Hugging Face:
- 速度:5090+5060 Ti 上 665 tok/s 结构化输出、354 tok/s 正文、64k 上下文 prefill 7,317 tok/s(IQ3XXS,400W);单 5090 也可用,约慢 12%
- 并发:最多 8 用户真实并发,MTP 启用时 8 流总吞吐 623 tok/s
- 自研视觉编码器:GPU 上比 llama.cpp 快 3 倍,CPU 上 4 倍
- 权重重打包(非重量化)为单个 .basalt 文件,含元数据/视觉/MTP
- OpenAI + Anthropic 兼容 API,带吞吐/专家分布监控的简易服务端 UI
作者解释未上游合并的原因:重写了大部分 decode 和部分 prefill 内核,砍掉了 AMD/Intel 及老卡支持。自称"vibe coded,但是快"。
「编程与Agent」频道最新
- 开发者观察:让 agent 修你不懂的 bug,就是现实版连续回形针最大化 — brandon_xyzw · 2026-10-10
- exe.dev 推出 ssh 即用开发沙盒,为开发者和 AI agent 提供云端 VM — davidcrawshaw · 2026-10-10
- Surge AI 发布 sudo L7 基准:60 个真实任务测编码 Agent 的资深工程师判断力 — rmcwhorter99 · 2026-10-10
- 作者上线实时直播:展示 AI 智能体搜寻新行星时使用的图像 — BLUECOW009 · 2026-10-10
- 同时跑 5 个 AI 编码会话,开发者只能来回切窗口问「进度如何?」 — tdhopper · 2026-10-10
- Cognition 演讲:91% 的 Devin 会话无需人类即可自主启动 — charles_irl · 2026-10-10