YC 创业公司 OneTriangle 发布 KV Cache 传输推理引擎
brianryhuang · x · 2026-08-25
OneTriangle (YC S26) 发布了一种基于 KV Cache 传输优化的推理引擎,旨在降低成本和延迟。
技术原理:
- 小模型 Prefill,大模型 Decode:在小模型上处理输入,将其 KV 张量投影到大模型的注意力空间,大模型直接基于填充好的缓存进行解码。
- 成本降低:Prefill 阶段成本降低 61%。
- 速度提升:首字生成时间提升 2.5 倍(Qwen3 4B→14B 测试中从 4.3s 降至 1.7s)。
商业落地:
- 目前支持 DeepSeek V4 Flash,价格低至 $0.15/M (Input) 和 $0.35/M (Output)。
- 兼容 Llama、Qwen、Mistral、Gemma 等开源模型。
- 用户只需修改一行配置即可接入。
「创投」频道最新
- 一边唱衰一边签单:IT 巨头一年拿下 75 亿美元 AI 合同 — dhruv2038 · 2026-08-25
- 前沿模型公司面临 commoditization,经济前景存疑 — jfiance · 2026-08-25
- Pika 推出 API 俱乐部:聚合多模态模型,价格低至竞品 25% — gizakdag · 2026-08-25
- Joseph Jacks 劝阻 Hugging Face 以 130 亿美元出售 — JosephJacks_ · 2026-08-25
- 英伟达战略揭秘:通过投资开源生态对冲 OpenAI 与 Anthropic — markjeffrey · 2026-08-25
- 如何从 0 获得前 100 个付费用户:实战经验汇总 — kylegawley · 2026-08-25