OreoLook:三层缓存架构让普通 CPU 也能低延迟跑 LLM 网络搜索
pollinations · hf · 2026-09-11
OreoLook 提出面向普通 CPU 硬件的三层缓存架构,降低 LLM 网络搜索的冗余调用与延迟:
- 会话窗口缓存:维护长时间运行的对话上下文
- 语义相似度匹配:命中相似查询时避免重复调用 LLM
- 去重嵌入:对结果做嵌入去重,进一步压缩重复计算
目标是在中低端硬件上支撑长时对话中的低延迟网络搜索,减少重复的 LLM 调用开销。
「Infra」频道最新
- AI 芯片创企 Positron 融资 8.75 亿美元,估值达 50 亿美元 — Scobleizer · 2026-09-11
- Positron AI 融资 2.3 亿美元估值破十亿,Arm 参投 — seanmcdonaldxyz · 2026-09-11
- 推理提速改变 Agent 工作流:Cerebras 实测并行代理更少、产出不降 — MatthewBerman · 2026-09-11
- Baseten 收购 Blaxel,押注下一代智能体基础设施 — baseten · 2026-09-11
- Skild S1 看一段视频即可上手新任务,年营收已破 1 亿美元 — NVIDIA Blog · 2026-09-11
- 超大规模厂商有能力分解 RSA-1024,单个成本约 3000 万美元 — rickasaurus · 2026-09-11