Fireworks 发现推理低效,延后 GLM-5.3 上线
AccBalanced · x · 2026-08-30
Fireworks AI 在部署 GLM-5.3-Flash 时发现开源引擎在 AIME & GPQA 等重推理基准上,思考长度是 Zai API 的两倍,分数相同但 Token 效率更低。为解决这一潜在的质量问题(如触及 maxtokens),团队决定延后上线调查。对比其他非官方提供商,确认了该差异,并与 vllmproject、Inferact 联合调查。最终 Fireworks 推出私有预览端点,Zai 也更新了 API 以修正该问题。
所属事件:Fireworks 修复 GLM-5.3-Flash 过度思考问题后上线(2 条相关)→
「Infra」频道最新
- Google Cloud Monitoring MCP 连接器发布 — modelcontextprotocol · 2026-09-01
- Distributed.systems发布可审计的Agent基础设施 — arthurcolle · 2026-09-01
- ChatGPT 启用记忆和历史会话是否增加 Token 消耗? — ssunki · 2026-09-01
- 工程师深挖 ROCm,修复 MI350X 推理崩溃并发现 9 个 Bug — AnushElangovan · 2026-09-01
- 40nm 神经动力学芯片:利用电导漂移实现单次迭代 2.12ms 延迟 — maier_ak · 2026-09-01
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01