研究者点破 LLM 验证软肋:「核查」无法形式化保证
anshulkundaje · x · 2026-09-29
斯坦福研究者 Michael Zlin(经 Anshul Kundaje 转发)指出 AI 系统在科学发现任务中的一个深层局限:即使模型生成的候选集覆盖足够,其「核查」环节也无法形式化验证——没有任何机制能保证模型真的验证了一条声明,而不是生成了一段听起来很流畅的验证文本。这一坦率反思引发了对 AI 自主科研可靠性的讨论:输出流利不等于推理可信,形式化保证的缺失是当前 LLM 做科学验证的硬伤。
「研究」频道最新
- Pinductor 用 LLM 先验学 POMDP 世界模型,在线交互仅 DreamerV3 的 1/330 — burny_tech · 2026-09-29
- MIT Miller 实验室提出 PEM-UDE,从嘈杂混沌数据中恢复可解释方程 — burny_tech · 2026-09-29
- SIGReg 正则揭示 JEPA 隐含对比机制:批内样本成对互斥 — burny_tech · 2026-09-29
- 作者撰文:AI 模型的真实能力很可能比表面表现更强 — zetalyrae · 2026-09-29
- NanoGPT embedding table 再获免费提升,与 ngrammer 论文结论互相印证 — _arohan_ · 2026-09-29
- AI 生成数学证明该不该署名?研究者:有效证明公开即有价值 — aran_nayebi · 2026-09-29