0.57MB 路由模型降本68%
Negaaaa7 · reddit · 2026-07-20
作者称自己用 Prompt Compass 把 LLM 成本降低了 68%。这是一个只有 0.57 MB 的小模型,能够在一次约 5 ms 的 CPU 调用里完成四类判断。
它做什么
它把原本常常拆成多模型、多次网络往返的流程合并到一起:
- 提示词路由
- PII 扫描
- jailbreak 检测
- 本地/云端分流
结果数据
- 在 2,022 条留出真实提示词上评测
- 四分类整体准确率 82%
- 在 lmsys/toxic-chat 上 jailbreak 召回率 87.5%
- 对真实提示词的误拦截低于 5%
- 在 15 个 PII 规避攻击样本上,作者对比中达到 100% 召回、0 泄漏
局限
- 大约 1/5 的提示词会被误分流,主要是 local→cloud,更多是成本损失而非安全风险
- 像“act as...” 这种人格提示经常会被判成 jailbreak,需要人工复核
- 它只看单轮提示词,抓不到慢速、多轮渗透式攻击
集成方式
项目提供:
- 本地运行的 npm SDK
- 托管 API
- VS Code / Cursor 扩展
作者还说明:扩展只是托管 API 的薄客户端;真正本地运行的是 SDK。它不能拦截 Copilot/Cursor 内置聊天。扩展同时也上了 Open VSX,并提供免费档。
所属事件:仅0.57MB的本地路由器大幅削减LLM成本(2 条相关)→
「编程与Agent」频道最新
- 开发者用 GPT-6 Astra 搭配 Hyper3D Rodin 做出交互式 3D 产品展示 — nikola_mr64990 · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11