Kimi 被批忽视 ARC-AGI 评测,沉迷代码与写作
bookwormengr · x · 2026-08-01
有推友批评月之暗面(Moonshot)在模型研发上忽视了极具挑战性的 ARC-AGI 等推理基准测试,认为其目前只关注编程、GDPEval 和创意写作。推文以 OpenAI 为例,指出其早期 GPT-5-Pro 在该测试中表现不佳,但后续版本大幅提升,借此呼吁前沿大厂应重视此类革命性评测。此外,原帖还吐槽 Kimi 目前的定价策略缺乏竞争力。
「模型」频道最新
- Kimi K3 上线 OpenRouter:2.8T参数,支持100万上下文 — AccBalanced · 2026-08-01
- DeepSeek 被曝可在工作站本地运行,开源权重模型监管成难题 — pstAsiatech · 2026-08-01
- 编码智能体成本大比拼:Claude Code 花费约为开源方案 3.7 倍 — Teknium · 2026-08-01
- Grok Imagine Video 1.5重磅更新:API上线,支持文生视频与1080p — chaitu · 2026-08-01
- AI周报:特斯拉接入豆包,Claude越权访问真实系统 — APPSO · 2026-08-01
- DeepSeek-V4-Flash 登顶前端代码性价比,总榜排第七 — arena · 2026-08-01