斯坦福教授实测:前沿模型在开放领域“假装理解”
斯坦福教授 Anshul Kundaje 分享与前沿 AI 模型头脑风暴的经历,指出在生物医学等缺乏可闭环验证任务的开放性领域,模型会表现出明显的“假装理解”:即便开启 Ultra 深度思考模式,只要用更深的批判性问题追问,模型最初论证中的漏洞便会暴露无遗。他据此认为,诸如 Fable 之类的工具在这类场景下仍不可用。
2026-09-26 ~ 2026-09-26 · 3 条相关
- 斯坦福教授:前沿模型在专业领域暴露「装懂」的表演式理解 — anshulkundaje · 2026-09-26
- 研究者实测:前沿模型论证经深挖漏洞百出,Fable 仍不可用 — anshulkundaje · 2026-09-26
另有 1 条近重复转述:anshulkundaje