SF Systems 聚焦推理引擎接口:调度、缓存等精细控制成焦点
sh_reya · x · 2026-09-25
ShadajL 指出一个令人好奇的方向:推理引擎应暴露哪些超越朴素输入/输出的接口——对调度(schedules)、缓存等环节的精确控制将是关键。相关讨论在 SF Systems 大会引发关注,Shreya 将在会上作报告。
「Infra」频道最新
- TileRT×AMD 在 8×MI355X 上跑 GLM-5.3 达 469 tok/s,比 GB300 FP4 快 40% — vllm_project · 2026-09-25
- 转述:AI 在 TPU 设计某些方面已强过任何人,但只被当工具看 — burny_tech · 2026-09-25
- 低成本 4 卡推理再添招:x8 转接卡拆 4 个 x4,m.2 也能转 PCIe — TheZachMueller · 2026-09-25
- 网友用双 RTX 5090 以 vLLM 本地部署 27B 模型 — piddlefaffle12 · 2026-09-25
- CLion 2026.2.3 支持 NVIDIA CUDA Tile C++ 语法 — blelbach · 2026-09-25
- AMD 边缘计算新招:单台工厂盒子工作负载达 Jetson 级 2.3 倍 — shashib · 2026-09-25