斯坦福教授实测:前沿模型在开放领域“假装理解”

斯坦福教授 Anshul Kundaje 分享与前沿 AI 模型头脑风暴的经历,指出在生物医学等缺乏可闭环验证任务的开放性领域,模型会表现出明显的“假装理解”:即便开启 Ultra 深度思考模式,只要用更深的批判性问题追问,模型最初论证中的漏洞便会暴露无遗。他据此认为,诸如 Fable 之类的工具在这类场景下仍不可用。

2026-09-26 ~ 2026-09-26 · 3 条相关

另有 1 条近重复转述:anshulkundaje