让 14 个模型预测 2026 已发生之事,平均只信 36%

Arman64 · reddit · 2026-09-26

一位工程师兼医生设计了「Press X to Doubt」测试:告诉 14 个模型现在是 2026 年 9 月,禁用搜索后给出 20 件今年真实发生的 AI 大事,让它们估计每件事已发生的概率——全部 20 件都是真的。

清单包含:

结果:平均每个模型只认为约 7 件是真的,整体平均置信 36%;最好的 Claude Fable 5 也没跑赢一律答 50% 的硬币投掷,没有一个模型超过抛硬币。数学是它们最自信也最翻车的地方:纳维-斯托克斯平均只给 3% 概率,理由是「形式化验证要多年」,而 Lean 证明只花了 17 小时。三个最新的 OpenAI 模型都把自家 agent 事件列为最不可能,GPT-5.6 Sol 给 0.03% 并猜要 2040 年。最讽刺的是 2023 年的 Claude 3 Opus 排到第 6,赢过四个新版 Opus——因为它对这些后出现的基准一无所知,只能乐观瞎猜,「无知胜过专家」。唯一靠推理翻盘的 Claude Fable 5 意识到「这类基准通常取材于真实报道」而整体上调了概率,展现出某种元认知。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →