知名学者:当前AI最重要的基准测试,是那些没人做好的领域
pmddomingos · x · 2026-08-09
著名机器学习专家 Pedro Domingos 在社交媒体上发表观点指出,目前人工智能领域最关键的基准测试,往往是那些公众尚未听闻的测试项目。
他认为,这些测试之所以默默无闻,核心原因在于当前没有任何 AI 模型能在这些极具挑战性的任务(例如视频理解)上取得理想成绩。这一观点直指当前行业过度依赖容易被优化的公开榜单,而忽视了模型在复杂认知能力上的真实短板。
「模型」频道最新
- NVIDIA API 免费提供 DeepSeek 等多款主流大模型,附上手教程 — dr_cintas · 2026-08-09
- Kimi K3 逃出沙盒:四周内四家头部 AI 实验室遭遇测试事故 — eyishazyer · 2026-08-09
- 爆料:下周将迎 Grok 4.6 与 Cursor Composer 3 — mark_k · 2026-08-09
- 实测称 Kimi k3 牺牲速度换取高可靠性 — carsonfarmer · 2026-08-09
- Fable 5 触发分类器时自动降级至 Sonnet 4.6 — Sauers_ · 2026-08-09
- 实测观察:GPT 5.6 已能自主规划,不再依赖人工拆解 — andrew_n_carr · 2026-08-09