Gisting 技术:压缩 Prompt Token 可在保持行为下降低 75% 成本
morgymcg · x · 2026-08-22
帖子介绍了“Gisting”技术,即寻找一组能引发与完整 System Prompt 相同行为的特殊 Token。该方法可将 Prompt 大小减少至约 25%,从而显著提升吞吐量并降低成本。
Shopify 工程实践详情:
- 压缩效果:Shopify 将其 GraphQL Agent 的 System Prompt 从约 6000 tokens 压缩至 1500 个 gist tokens(4:1 压缩比),且未损失预测质量。
- 性能提升:在 350 RPM 负载下,首字延迟(TTFT)从 438ms 降至 354ms,端到端延迟从 6.8s 降至 4.2s,QPS 从 20.2 提升至 23.4。
- 技术原理:通过知识蒸馏学习一组特殊 Token 的嵌入,在推理时用这些 Token 替换冗长的 Prompt,冻结模型权重以诱导相同的行为表现。
- 资源节省:由于吞吐量提升,得以减少分配给该 Agent 的 GPU 数量。
所属事件:Gisting 技术受关注:压缩 Prompt 可降 75% 成本(3 条相关)→
「Infra」频道最新
- 阿里字节论文:模型推理不再是 Agent 主要瓶颈,系统调度成关键 — rohanpaul_ai · 2026-08-22
- 观点:GPU 价格严重低估,考虑到模型能力极其划算 — Technical_Ad_6106 · 2026-08-22
- 从零构建引擎:在免费 ARM 核心上超越官方三进制 8B 模型性能 — Annual_Manner_5901 · 2026-08-22
- Nvidia 新 Vera CPU 实测:大内存带宽与 FP8 加速 Agent 执行 — pzakin · 2026-08-22
- Bittensor 上线沼气供电 GPU 集群,提供 4090/5090 租赁 — markjeffrey · 2026-08-22
- SilkStack v2.2 发布:集成 WebGPU 本地语义搜索与自定义 Qwen 嵌入模型 — skk80 · 2026-08-22