Ollaya本地跑决策模型:RTX 4090上8毫秒答五问
petrusenko_max · x · 2026-09-27
Ollaya 支持在本地运行「决策模型」:单次前向传播即输出带类型标注、校准过的答案,不经过 token 生成。在 RTX 4090 上回答5个问题仅需 8–10 ms,而 TypeSafe 托管的 Jev API 中位延迟为 236–276 ms。TypeSafe SDK 0.7.1 可不改动代码直接对接 localhost:11435。
「Infra」频道最新
- 开发者吐槽:99% 场景下 Vercel 已不划算,agents 可安全用 Cloudflare — generativist · 2026-09-27
- ZeroHedge 算 GPU 收益账被指用错吞吐,低估 8-10 倍 — zephyr_z9 · 2026-09-27
- MLX 社区投票:前三名视觉模型全部由 MLX-VLM 驱动 — andrejusb · 2026-09-27
- 1250 万美元租千卡 GB300:『新实验室』算力经济账算给你看 — deedydas · 2026-09-27
- 12GB 显存跑 85GB DeepSeek-V4-Flash,解码提速至 3 tok/s — Chekhovs_Shotgun · 2026-09-27
- 开源 AI 需求升温,预测 2027 年消费级算力将供不应求 — JosephJacks_ · 2026-09-27