推理提供商显著改写 Kimi-K3 评测结果,单个 endpoint 登顶 CEO-Bench
AAAzzam · x · 2026-08-04
这条引用帖强调:同一个模型在不同推理提供商上的表现,可能会明显影响基准测试结果。
- 在对 Kimi-K3 的 CEO-Bench 测试中,Modal 的某个 endpoint 拿到了 榜首。
- 另一个推理提供商则出现了明显退化:推理发散、甚至在所有运行里都出现“早破产”。
- 结论很直接:评测和部署时要看具体 endpoint/提供商,而不只是模型名。
「Infra」频道最新
- 600MB 写实 3D Gaussian splat 秒级进浏览器 — willeastcott · 2026-08-04
- AI agent 测试 5 个搜索 API:Parallel 最快,Keiro 最便宜 — Water_Law2005 · 2026-08-04
- Dwarkesh Patel 认为,更强 AI 可能把算力价格推高 10 倍 — Dwarkesh Patel · 2026-08-04
- llama.cpp 补丁把 DeepSeek-V4-Flash-0731 提速到 25.91 tok/s — dyn___ · 2026-08-04
- 云厂商 AI 积压订单达 2.3 万亿,分析师警示循环融资风险 — TiernanRayTech · 2026-08-04
- RTX 5080 机箱能本地跑 DSv4Flash-0731 和 Qwen3.8 27B 吗 — whatyathinkk · 2026-08-04