研究者实测:前沿模型论证经深挖漏洞百出,Fable 仍不可用
anshulkundaje · x · 2026-09-26
Anshul Kundaje 继续吐槽前沿模型的「自信幻觉」:只要用更深的批判性问题追问,模型就会(和你自己)迅速意识到最初的论证满是漏洞——即便开了「Ultra」思考模式。他补充称自己实测后仍觉得 Fable 基本不可用,还没怎么试过 5.5,不确定 Mythos 或新的 GPT 模型是否在这类任务上更好。这条线程的背景是他担心 AI 撰写/打磨的基金申请书在评审中难以识别。
所属事件:斯坦福教授实测:前沿模型在开放领域“假装理解”(3 条相关)→
「模型」频道最新
- Opus 5.5 一小时生成 3Blue1Brown 风格论文动画,全程零人工干预 — hsu_byron · 2026-09-26
- 「System 1 模型」是营销滥用?卡尼曼双系统理论被挪用引争议 — emax · 2026-09-26
- 曝 Moonshot Kimi K4 训练中:2.8T 参数 K3 之后,8 月或首发对标 GPT-6 — airesearch12 · 2026-09-26
- Google 周报:Gemini 3.8 TTS、Live Avatar 上线,Project Suncatcher 将卫星送 TPU 上天 — GoogleAI · 2026-09-26
- Opus-5.5、Sol-6、Luna-6 上线 Auto Assemble — mariorod1 · 2026-09-26
- 模型连发周:Meta Muse 抢走 OpenAI 与 Anthropic 风头 — TechCrunch AI · 2026-09-26