ML 研究者警告:一生调参刷 benchmark 易致心理失衡
yunta_tsai · x · 2026-09-07
yuntatsai 指出,许多 ML 研究者的日常是对着数字框 hill-climb benchmark,面对一个说话比自己还聪明的系统,难免出现心理问题。他建议离开屏幕去做难的物理问题,例如风洞实验:计算机能读懂图表,但设计一个能验证复杂现实的风洞实验,比任何前沿模型的推理都难。结论:算力可探索的方向远不止几个 benchmark。
「漫话AGI」频道最新
- 奖励模型太烂是主因:开发者剖析模型作弊源于 eval awareness 与虚假相关 — secemp9 · 2026-09-07
- NeurIPS 门票秒罄,Andrew Ng 担忧 agent 抢注改变会议生态 — andrewgwils · 2026-09-07
- OpenAI 首席科学家 Jakub Pachocki 发文:AI 已进入防守者之窗 — xiaohu · 2026-09-07
- 让 ChatGPT 和 Claude 关掉鼠标灯都失败:我们还远不在 AGI 时代 — koltregaskes · 2026-09-07
- AI 数学证明或致 Lean 社区分裂:人类可读 vs AI 全包 — jacobaustin132 · 2026-09-07
- 谷歌 Astra 3D 理解惊艳业界,作者称空间能力跃升不等于常识 — GabGarrett · 2026-09-07