Ollaya本地跑决策模型:RTX 4090上8毫秒答五问

petrusenko_max · x · 2026-09-27

Ollaya 支持在本地运行「决策模型」:单次前向传播即输出带类型标注、校准过的答案,不经过 token 生成。在 RTX 4090 上回答5个问题仅需 8–10 ms,而 TypeSafe 托管的 Jev API 中位延迟为 236–276 ms。TypeSafe SDK 0.7.1 可不改动代码直接对接 localhost:11435。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →