Yarin Gal 实测:LLM 做开放性研究会把问题坍缩成已知工作
yaringal · x · 2026-09-23
牛津大学教授 Yarin Gal 测试让 AI 研究助手 Fable 以「学生」身份研究一个开放性假设,发现当模型声称某篇论文反驳了他的假设时,他不得不与其争辩、纠正其误读。
他的结论:
- 如果只是优化一个定义清晰的目标,LLM 表现尚可
- 但面对开放性问题时,LLM 会把问题坍缩到已知工作(known work)上,而不是真正回答问题
这一观察对「AI scientist」类产品的能力边界是有价值的实证参考。
所属事件:牛津学者 Gal:LLM 缺少脚手架就不擅长做科学(3 条相关)→
「研究」频道最新
- 安全老兵发问:10 亿美元加无限 token,如何真正改变网络安全 — chrisrohlf · 2026-09-23
- Grok 解析 DeepSeek 训练:为何用 DualPipe+ZeRO-1 而非 ZeRO-3 — TheZachMueller · 2026-09-23
- 新基准 ObviousBench:人类全对送分题,GPT-Luna 拿下两冠 — adamallcock · 2026-09-23
- 用「假设-实验-证伪」循环框定自动化科学的可行路径 — burny_tech · 2026-09-23
- 范畴论深度学习尚无实用架构,几何深度学习才是先例 — burny_tech · 2026-09-23
- Voxiferi 开源 VoxWall:为 LLM 训练数据装一道「入站防火墙」 — CackleRooster · 2026-09-23