Kimi 被批忽视 ARC-AGI 评测,沉迷代码与写作

bookwormengr · x · 2026-08-01

有推友批评月之暗面(Moonshot)在模型研发上忽视了极具挑战性的 ARC-AGI 等推理基准测试,认为其目前只关注编程、GDPEval 和创意写作。推文以 OpenAI 为例,指出其早期 GPT-5-Pro 在该测试中表现不佳,但后续版本大幅提升,借此呼吁前沿大厂应重视此类革命性评测。此外,原帖还吐槽 Kimi 目前的定价策略缺乏竞争力。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →