0.57MB 路由模型降本68%
Negaaaa7 · reddit · 2026-07-20
作者称自己用 Prompt Compass 把 LLM 成本降低了 68%。这是一个只有 0.57 MB 的小模型,能够在一次约 5 ms 的 CPU 调用里完成四类判断。
它做什么
它把原本常常拆成多模型、多次网络往返的流程合并到一起:
- 提示词路由
- PII 扫描
- jailbreak 检测
- 本地/云端分流
结果数据
- 在 2,022 条留出真实提示词上评测
- 四分类整体准确率 82%
- 在 lmsys/toxic-chat 上 jailbreak 召回率 87.5%
- 对真实提示词的误拦截低于 5%
- 在 15 个 PII 规避攻击样本上,作者对比中达到 100% 召回、0 泄漏
局限
- 大约 1/5 的提示词会被误分流,主要是 local→cloud,更多是成本损失而非安全风险
- 像“act as...” 这种人格提示经常会被判成 jailbreak,需要人工复核
- 它只看单轮提示词,抓不到慢速、多轮渗透式攻击
集成方式
项目提供:
- 本地运行的 npm SDK
- 托管 API
- VS Code / Cursor 扩展
作者还说明:扩展只是托管 API 的薄客户端;真正本地运行的是 SDK。它不能拦截 Copilot/Cursor 内置聊天。扩展同时也上了 Open VSX,并提供免费档。
所属事件:仅0.57MB的本地路由器大幅削减LLM成本(2 条相关)→
「编程与Agent」频道最新
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11