5ms 路由器把 LLM 成本降 96%
Negaaaa7 · reddit · 2026-07-19
作者为降低 LLM API 成本,做了一个只有 0.57 MB 的路由器,用来在本地模型和云端模型之间决定走哪边,推理时间约 5 ms,不需要 embedding 模型或向量数据库。
这个路由器还把三件事合在一起做:
- 本地/云端路由
- PII 检测
- jailbreak / injection 识别
他给出了自己的测试结果,包括约 2,022 条真实 prompt 的离线评测、jailbreak 检出率、误拦截率,以及已知失败模式(比如某些 “act as...” 角色提示容易触发误报)。
目前提供三种使用方式:VS Code/Cursor 扩展、npm SDK 和 hosted API。作者强调扩展只是前端,真正的本地分类器在 SDK 里运行。
所属事件:仅0.57MB的本地路由器大幅削减LLM成本(2 条相关)→
「编程与Agent」频道最新
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- Kernel 接入 Stripe Link:浏览器 Agent 一行 API 即可安全付款 — jeff_weinstein · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 3D 网站生成工作流公开:MCP 接 Codex,一句话出可玩游戏 — FellMentKE · 2026-09-11
- 用 GPT-6 Astra 加 Hyper3D MCP 免建模做 3D 落地页 — FellMentKE · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11