斯坦福教授吐槽:LLM 评审永远能挑出一堆毛病,装懂本色尽显

IanArawjo · x · 2026-09-27

引用斯坦福教授 Anshul Kundaje 的观察:在前沿模型缺乏可验证闭环的开放领域(如生物学)与之头脑风暴时,其「假装理解」的破绽会暴露无遗。Andrew Rosen 补充另一个视角:让 LLM 评审论文或申请书,它永远会说「不错但有缺陷」——即便是优秀工作也会被列出一份「缺陷清单」,这些毛病表面合理、实际质量很低。两条观察共同指向 LLM 在专家级判断任务上的系统性弱点:倾向编造批评以显得有用。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →