Spanda:Rust 引擎把幻觉检测延迟压到 760 纳秒,零 GPU
liquidngas · hn · 2026-09-12
开发者开源了 Spanda,一个用 Rust 编写的亚微秒级 LLM 认知不确定性量化与幻觉拦截引擎及网关,附 Python SDK(pip install spnda)。
核心思路
- Semantic Entropy(Nature 2024)检测幻觉有效,但其二次方 NLI 交叉编码器是瓶颈:DeBERTa 带来约 90ms GPU 开销,无法用于实时生产环境。
- 作者发现归一化精确匹配熵(Rsc)在结构化推理任务(GSM8K)上达到与 Semantic Entropy 相同的判别 AUROC,且可在 CPU 上于 1 微秒内完成(实测 760 纳秒)。
与 Python 代理实现对比
- 核延迟:760 ns(Rust)vs 15 ms(Python)
- 内存 RSS:约 3 MB vs 230 MB
- 冷启动:3.6 ms vs 1.17 s
作者在 HN 上开放关于 Rust 实现、零 GPU 数学原理和基准结果的讨论。
「Infra」频道最新
- DeepInfra 推 DeepCluster 专属 B300 集群,低至 2.99 美元/GPU 时 — niloofar_mire · 2026-09-12
- OpenAI 揭秘存储平台 Habitat:Python 服务峰值每秒超 2000 万请求 — xeophon · 2026-09-12
- 腾讯开源 Agent 沙箱 CubeSandbox v0.7:冷启动 60ms,支持跨节点暂停恢复 — dr_cintas · 2026-09-12
- 32GB 显存跑 Qwen3.8 27B:动态配置让上下文从 17 万扩到 26 万 token — wadeAlexC · 2026-09-12
- DigitalOcean 推 M.A.R.S. 托管 Agent 运行时,首发接入 OpenAI Agents API — OpenAIDevs · 2026-09-12
- 分析师估算:Instinct 类应用每年或烧掉上亿美元 token 成本 — ivan_bezdomny · 2026-09-12