Kimi K3 登顶开源 ARC-AGI 评测,比肩 Claude Opus
mhmazur · x · 2026-08-01
Kimi K3 模型在 ARC-AGI 基准测试中取得了突破性成绩,证明了其作为开源前沿模型的实力。
根据 ARC Prize 官方验证的数据:
- ARC-AGI-2:得分 60.4%,单任务成本 1.59 美元。
- ARC-AGI-1:得分 94.5%,单任务成本 0.77 美元。
官方称其为目前评估过得分最高的开源权重模型,其在 ARC-AGI-2 上的表现甚至可以媲美两个月前发布的 Claude Opus(低配版)。
所属事件:Kimi-K3 跑出 60.4% 成绩,登顶 ARC-AGI-2(3 条相关)→
「模型」频道最新
- DeepSeek v4 Flash 被指生成代码陷入死循环 — kwizzle · 2026-08-01
- DGX Spark 本地部署:Qwen 3.5 122B 后的模型升级选择探讨 — Voxandr · 2026-08-01
- 两台SuperPod日产25万亿token?揭秘RL算力神话 — zephyr_z9 · 2026-08-01
- 实测多款Agent框架:Kimi K3轻量化表现佳,Claude成本高 — omarsar0 · 2026-08-01
- agentic RL 赋予 LLM「生命力」:模型变得狂热且投入 — teortaxesTex · 2026-08-01
- 实测用 ChatGPT 在 iPhone 上直接生成应用 — reach_vb · 2026-08-01