研究者实测:前沿模型论证经深挖漏洞百出,Fable 仍不可用

anshulkundaje · x · 2026-09-26

Anshul Kundaje 继续吐槽前沿模型的「自信幻觉」:只要用更深的批判性问题追问,模型就会(和你自己)迅速意识到最初的论证满是漏洞——即便开了「Ultra」思考模式。他补充称自己实测后仍觉得 Fable 基本不可用,还没怎么试过 5.5,不确定 Mythos 或新的 GPT 模型是否在这类任务上更好。这条线程的背景是他担心 AI 撰写/打磨的基金申请书在评审中难以识别。

所属事件:斯坦福教授实测:前沿模型在开放领域“假装理解”(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →