斯坦福教授:LLM 在该谨慎处最自信,生物领域没有「校验器」管住幻觉
anshulkundaje · x · 2026-09-26
斯坦福教授 Anshul Kundaje 转发讨论:LLM 恰恰在最该谨慎的地方表现最自信。代码和数学领域存在可执行的校验器(测试、证明),能把模型的「虚张声势」打回去;而开放领域的生物学从未有过这样的校验机制,模型幻觉更难约束。
「模型」频道最新
- Agent Arena 帕累托前沿:DeepSeek V4.1 单任务6美分,国产模型霸占低价区间 — arena · 2026-09-26
- GPT-6 Sol 登 Agent Arena 榜第6,成本仅竞品44%改写性价比前沿 — arena · 2026-09-26
- TypeSafe 发布决策型模型 Jev:不生成文本,直接输出可执行决策 — hwchase17 · 2026-09-26
- Agent Arena 完整榜单:Claude Fable 5.1 居首,累计评测超200万会话 — arena · 2026-09-26
- Matt Shumer 称 Opus 5.5 自作主张在其网站里藏直升机彩蛋 — mattshumer_ · 2026-09-26
- 一个两栖动物问题就能识别模型评测:研究者提出 spurious probe — AdtRaghunathan · 2026-09-26