AI 模型在智力测试中频频翻车,人类仍占上风
nordicinst · x · 2026-08-26
MIT Technology Review 报道,尽管 AI 在解决纽约时报连线谜题等任务上进步迅速,但在面对经典逻辑谜题和视觉谜题时仍容易失败。文章通过多个实例(如骑士与无赖谜题、ARC-AGI 基准测试)展示了模型与人类认知的差异,指出模型往往难以处理谜题中的细微变化,视觉推理仍是其弱项。这些测试揭示了 AI 当前能力的边界。
「模型」频道最新
- Tiel-Coder-35B-A3B 发布 GGUF 版,支持视觉与高效推理 — peculiar-ragdoll · 2026-08-26
- 观察:Claude 开头这句词通常意味着搞砸了 — airesearch12 · 2026-08-26
- OpenRouter 平台模型使用量随时间变化趋势 — Which-Breadfruit-926 · 2026-08-26
- AI 仍过不了这些智力测验:空间旋转与视觉推理是明显短板 — MIT Tech Review AI · 2026-08-26
- 数据称开发者对模型零忠诚:Ox Alpha 三天碾压 DeepSeek V4 Flash — FinanceYF5 · 2026-08-26
- OX Alpha 凭借免费策略登顶 OpenRouter 使用量榜首 — Hesamation · 2026-08-26