陈天奇转发式吐槽:AA-intelligence 基准题自己都看不懂
WenhuChen · x · 2026-09-13
Wenhu Chen(陈天奇)表示最近看了 AA-intelligence 基准里的实际任务,很多题目自己连看懂都困难,更别说解答,直呼「在 AI 模型面前像个傻子」。这侧面反映当前高难 agent 基准的任务复杂度已远超普通专家直觉。
「模型」频道最新
- 自建编排器报错"astra 无权访问 Daybreak",神秘模型现身 — LeopardBernstein · 2026-09-13
- kalomaze 直言 Opus 5 是个很糟糕的模型 — kalomaze · 2026-09-13
- 评论人:OpenAI 数学证明若出自无名数学家,舆论会是另一番景象 — skdh · 2026-09-13
- GPT-6 Astra 不进聊天框:20 美元 Plus 每 5 小时仅 5-45 条,入口成新权限墙 — 新智元 · 2026-09-13
- LLM Architecture Gallery:一张图看尽各家大模型架构 — zainhas · 2026-09-13
- Schulman:仅读1930年前文本的模型经蒸馏竟超Claude 3 Opus — victor_explore · 2026-09-13