Together Compute 发布多节点推理引擎,支持近线性扩展
togethercompute · x · 2026-07-30
Together Compute 宣布其推理引擎支持多节点近线性扩展,从16 GPU到64 GPU,步骤/分钟从671提升至2248,且领先幅度随集群规模扩大(2节点1.79倍,8节点2.39倍)。该引擎为即插即用,只需一个 programid 字段即可接入现有配置,支持 KV offloading 和推测解码,格式无关,已兼容 OpenAI chat completions,并被 SkyRL 和 NVIDIA Dynamo 采用。
所属事件:Together AI 推出 ThunderAgent 引擎实现智能体推理翻倍提速(5 条相关)→
「Infra」频道最新
- Buildcleaner 开源工具可清理 443GB 构建缓存,免费 MIT 许可 — jasonkneen · 2026-07-30
- 大模型推理成本骤降:B200 单价已跌破 3 美元 — AccBalanced · 2026-07-30
- Yann LeCun 等探讨:LLM 是新型编译器,性能取决于算力 — yisongyue · 2026-07-30
- 高盛预测AI Token月处理量到2030年将激增70倍 — Beth_Kindig · 2026-07-30
- 244 GiB 大模型冷启动实测:耗时约 154 秒 — QuixiAI · 2026-07-30
- FP8 统一用于训练与推理解码,RL 端到端提速 16% — joecole · 2026-07-30