Kimi K3 成首个通过 Compound 内部基准的开源模型
peterjliu · x · 2026-07-29
Compound 团队分享了他们在多模型编排系统中的最新测试结果。该团队通过协调器 agent 和子 agent 组合不同模型的优势,以达到单一模型无法实现的帕累托最优。
在针对内部专属“检查清单”基准的长期测试中,此前只有近期的 Claude 模型能稳定通过,Gemini 基本无法完成,OpenAI 直到 Sol 5.6 版本才通过。最新测试表明,月之暗面的 Kimi K3 成为首个顺利通过该基准测试的开源模型。
所属事件:Kimi K3 通过 Compound 基准但缓存命中率被指拖累成本(2 条相关)→
「模型」频道最新
- Claude Opus 5 在 DeepSWE 上拿到 74%,登顶长程编码评测 — brandon_galang · 2026-07-29
- PostTrainBench v1.1 标记 234 次污染运行并强化反作弊 — scaling01 · 2026-07-29
- Nvidia 的 LatentMoE 论文刚发 6 个月就被用于预训练改造 — peterjliu · 2026-07-29
- 内部评测图比较各模型居中一个 div 要多少 token — BLUECOW009 · 2026-07-29
- 微软发布 Mage-VL:编码原生流式多模态模型,推理提速 3.5 倍 — pmttyji · 2026-07-29
- AI能力见顶?开发者激辩大模型正丧失通用性 — JacquesThibs · 2026-07-29