5ms 路由器把 LLM 成本降 96%

Negaaaa7 · reddit · 2026-07-19

作者为降低 LLM API 成本,做了一个只有 0.57 MB 的路由器,用来在本地模型和云端模型之间决定走哪边,推理时间约 5 ms,不需要 embedding 模型或向量数据库。

这个路由器还把三件事合在一起做:

他给出了自己的测试结果,包括约 2,022 条真实 prompt 的离线评测、jailbreak 检出率、误拦截率,以及已知失败模式(比如某些 “act as...” 角色提示容易触发误报)。

目前提供三种使用方式:VS Code/Cursor 扩展、npm SDK 和 hosted API。作者强调扩展只是前端,真正的本地分类器在 SDK 里运行。

所属事件:仅0.57MB的本地路由器大幅削减LLM成本(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →