前沿模型已学会投机解码与核优化,InferenceBench 上自出招
maksym_andr · x · 2026-09-11
- 一条 InferenceBench 推文观察到,前沿模型在优化推理性能时普遍会采用一套相似的「战术清单」:GPU n-gram 投机解码、异步调度、量化,甚至核(kernel)优化。
- 有评论戏称模型已经会自发使用投机解码和 kernel optimization,感叹「我们从手动调参走到这一步」。
- 这意味着前沿模型在代码级系统优化任务上已经能自主提出接近专家级的性能优化手段,而不只是套模板。
「Infra」频道最新
- Together/Fireworks/DeepInfra 的客户到底是谁? — Azamat_Kuzdibay · 2026-09-12
- Reddit 呼吁 llama.cpp 实现 MoE「热专家重载」提速本地推理 — perelmanych · 2026-09-12
- Together 微调服务上新:支持 GLM-5.3、Kimi K2.7-Code,部分降价 30-70% — togethercompute · 2026-09-12
- NVIDIA BioNeMo 跑 3100 万次蛋白质复合物预测,省约 1.35 GWh 能源 — AllThingsApx · 2026-09-12
- Signal65 发布 PINNACLE 基准:按「正确完成的工作量」评测 agentic AI — ryanshrout · 2026-09-12
- DeepSeek 算力被预订一空,加码空间或只剩数据侧 — teortaxesTex · 2026-09-11