Replacing Large Language Models with Jev Decision Models for Low-Latency Edge Service Orchestration
Delong Li, Xu Wang, Haochen Gong, Rui Lang, Guangsheng Yu
cs.DC, cs.NI
2026-09-19
Jev 替换边缘准入里的 LLM 解释器,决策延迟降 22.7–64.5%,高负载下完成率守 0.91、LLM 跌破 0.1
边缘节点收到的请求长这样:读出这张图里的文字、数据不许离开本站、很急。把这句话变成可执行任务,先要判断服务类型、数据可否外发、质量档位、紧急度。这个判断站在准入路径(admission path)上,排在排队、传输、执行之前。实验里的典型期限是 2 秒,而 LLM 一次解释调用零点几秒到几秒,还占着有限的准入槽位,慢调用让后面的请求排队,负载一高完成率就崩。
论文的出发点:目录有限的服务编排里,这个解释只是四到八个有界决策,不需要自由生成文本。要验证的是,专门做选择题的决策模型能不能整建制替换 LLM,延迟、准确率、账单各变多少。
整套对比架在一个类型化意图契约(intent contract)上:核心四个字段(服务、数据位置、质量档、紧急度),最多扩到八个,每个字段都是选项预先声明的选择题。服务目录作为服务字段的选项随请求传递,新服务上线不用重训。
阵容:Jev、自托管的 SemIf-Qwen3.5-4B 和 Laya(421M 参数),对阵 DeepSeek-V4.1-Flash、GLM-5.3-Flash、Qwen3.8-Flash 三个托管 LLM,另有规则解析器和 DistilBERT 分类器做参照。
| 指标 | Jev-1.13.0 | 最快 LLM(DeepSeek-V4.1-Flash) |
| 干净请求 EM(全字段精确匹配) | 0.950 | 0.987 |
| 8 字段契约 EM | 0.527–0.577 | 0.900–0.930 |
| 1–16 req/s 精确按时完成率 | 0.907–0.953 | 16 req/s 时 0.093 |
| 16 req/s 费用(USD/千次正确完成) | 0.038 | 0.58 |
33 个条件里,Jev 的中位决策延迟比最快的 LLM 低 22.7–64.5%,而且几乎不随条件动:干净请求 0.27 秒,垫到 16,384 token 是 0.42 秒,DeepSeek 同区间从 0.38 涨到 0.64 秒;八条请求捆成一条消息,Jev 整条 0.29 秒,Qwen3.8-Flash 涨到 3.79 秒。四字段契约下,每个正确决策的 API 费用低 59.7–80.9%,代价是几个点的 EM。尾部同方向:超过 0.5 秒的决策 Jev 占 0.7%,DeepSeek 占 19.0%,Qwen3.8-Flash 占 100%。
端到端才是重头。真实 OCR 服务里,Tesseract 自己只读对 180 张中的 92 张,Jev 的正确完成率 0.511,正好顶到识别器天花板,也没有任何解释器把图片发给位置约束禁止的节点;突发流量下 GLM-5.3-Flash 只完成 0.167。目录 churn 是决策模型的加分项:Jev 给没见过的服务命名,准确率 0.995–1.000,与已知服务无差别;DistilBERT 分类器用 92 个标注样本重训后,新服务准确率只有 0.142。
缓存一开,优势收窄:八条重复描述加缓存,除 Laya 外所有解释器的中位请求延迟都落到 0.06–0.09 秒,完成率差距抹平。Jev 的增益只属于需要新鲜决策的请求。
这篇把一个直觉做成了带数字的工程结论:热路径上的有界分类决策,不必付生成的钱。延迟稳、费用低、目录免重训,对做 agent 网关、意图路由、function calling 前置解析的人直接可用。边界也画得清楚:字段一宽、要判断「请求支不支持」时,LLM 仍占优。结论不是决策模型取代 LLM,是在窄契约上用几个点的准确率换延迟和吞吐。
作者自认的:八字段宽契约是替代边界,Jev 落后 DeepSeek 32.3–40.3 个点;不支持请求的检出 F1 是 0.723–0.929,LLM 为 0.889–1.000;费用随目录选项数上涨,64 个服务以上每次正确决策已比 DeepSeek 贵。
另有几处存疑: