TensorSharp 直读 label logits,结构化决策比 LocalJev 快 3.3 倍
fuzhongkai · reddit · 2026-09-23
TensorSharp(开源)开发者受 vLLM PR #57250 启发,为其推理服务新增原生 /v1/systemone 端点,用 DiffusionGemma GGUF 做 Jev 风格的结构化决策,并与原 LocalJev 引擎对比。
核心实现差异:TensorSharp 直接读取请求标签的 logits,而 LocalJev 让模型生成概率 JSON,因此输入长度差异巨大(平均 192.7 tokens vs 589.6 tokens)。
基准结果(12 案例 × 3 次重复,每请求 3 个决策):
- TensorSharp:36/36 有效请求,108/108 决策正确,p50 延迟 2.877s,p95 3.165s;
- LocalJev:27/36 有效(9 次因 JSON schema 校验失败返回 422),有效响应内决策 81/81 正确,p50 10.479s,p95 26.167s;
- 27 对配对成功请求中,LocalJev/TensorSharp 延迟比中位数为 3.345×。
作者强调这不是同提示词的纯内核对比,小样本也不宜当作通用精度基准。文中附本地复现步骤与 Python 示例。
「Infra」频道最新
- tinygrad 在 MI300X 上跑出 MiMo-V2.6-Pro 约 200 tok/s — AIFlow_ML · 2026-09-23
- 爆料:64GB 版 RTX 5090 研发中,但短期内难上市 — AIFlow_ML · 2026-09-23
- Swarm 推出 Qwen Image-2.1 推理引擎:1K 图生成仅 0.5 秒 — bingxu_ · 2026-09-23
- MTP 头被静默忽略:修复三行代码让 Mac 本地解码提速 63%-79% — Micha0827 · 2026-09-23
- 开源自托管备份方案Pluton:Restic+Rclone加密备份跨云复制 — tom_doerr · 2026-09-23
- AWS 开源 Strands harness:同一模型 agent 包裹层省 28% token — shashib · 2026-09-23