Kimi K3 登顶 pmpp-hard 评测,开源模型在硬核 Agent 任务中刷新 SOTA
xeophon · x · 2026-08-03
在最新发布的 pmpp-hard 评测中,开源模型展现出惊人的 Agent 实力。该测试涵盖了 69 个 GPU 内核任务,对 11 个模型进行了 3100 次 Agent 滚动测试,消耗超 58 亿 token。最终,Kimi K3 以 0.71 的得分夺得榜首,证明了开源模型在处理复杂硬核任务时同样能达到 SOTA 级表现。
「编程与Agent」频道最新
- 95%的Agent技能缺失激活指令,GitHub静态扫描揭示配置通病 — rseroter · 2026-08-03
- 监控 WordPress 中的「影子 AI」:违规 HTTP 调用追踪实践 — HaktanSuren · 2026-08-03
- Cloudflare发布@cloudflare/computer:让Agent按需在隔离环境与容器间无缝切换 — ritakozlov · 2026-08-03
- 微软推出 IQ Live 系列直播,聚焦企业级上下文感知 Agent 架构 — DanWahlin · 2026-08-03
- 大厂扎堆构建上下文层,AI时代的本体论与知识图谱成新战场 — brucemacv · 2026-08-03
- Codex额度耗尽?开发者探讨转向OpenCode等替代方案 — yacineMTB · 2026-08-03