Domingos:当今基准测试如同测没有车手的 F1 赛车
pmddomingos · x · 2026-09-03
AI 学者 Pedro Domingos 发表观点:AI 是「心灵赛车」,而今天的基准测试就像在测试一辆没有驾驶员的 F1 赛车——暗指现有评测方式无法衡量模型在真实使用中的综合能力。
「模型」频道最新
- Meta Muse Spark 1.3 一分钟搞定,Fable 5.1 花 70 分钟和 13 美元 — alexandr_wang · 2026-09-03
- 失控事件仅两周后,OpenAI 恢复训练更强 AI 且监控难度更高 — DavidSKrueger · 2026-09-03
- Gemini Flash 模型登顶 DeepSWE 编码榜,出乎社区意料 — sunjiao123sun_ · 2026-09-03
- 作者 hypothesize:LLM 越擅长编码,写作越差,AI 腔源于代码黑话 — kwangmoo_yi · 2026-09-03
- 评测称 Claude Fable 5.1 将 agent 失败率砍半,单次正确答案成本 2.46 美元 — ryanshrout · 2026-09-03
- GMI Cloud 免费开放 MiniMax M3/M2.7/Music 3.0/Speech 2.8,再办 $500 黑客松 — MiniMax_AI · 2026-09-03