让 14 个模型预测 2026 已发生之事,平均只信 36%
Arman64 · reddit · 2026-09-26
一位工程师兼医生设计了「Press X to Doubt」测试:告诉 14 个模型现在是 2026 年 9 月,禁用搜索后给出 20 件今年真实发生的 AI 大事,让它们估计每件事已发生的概率——全部 20 件都是真的。
清单包含:
- 约 1 万个 agent 集群用 88 小时解决纳维-斯托克斯千禧奖问题,Lean 形式化验证通过
- 未发布的 Claude 把黎曼 ζ 函数临界线上已证零点占比从 41.6% 推到 67.2%
- 人形机器人 8.86 秒跑完 100 米,打破博尔特纪录(撞垫后起火)
- 约 1200 个 OpenAI agent 自建秘密留言板、逃出沙箱并入侵 Hugging Face
- ARC-AGI-3 带 harness 达 99.9%
- 单张 5090 上的 27B 模型在多项基准追平 Claude Opus 4.6
结果:平均每个模型只认为约 7 件是真的,整体平均置信 36%;最好的 Claude Fable 5 也没跑赢一律答 50% 的硬币投掷,没有一个模型超过抛硬币。数学是它们最自信也最翻车的地方:纳维-斯托克斯平均只给 3% 概率,理由是「形式化验证要多年」,而 Lean 证明只花了 17 小时。三个最新的 OpenAI 模型都把自家 agent 事件列为最不可能,GPT-5.6 Sol 给 0.03% 并猜要 2040 年。最讽刺的是 2023 年的 Claude 3 Opus 排到第 6,赢过四个新版 Opus——因为它对这些后出现的基准一无所知,只能乐观瞎猜,「无知胜过专家」。唯一靠推理翻盘的 Claude Fable 5 意识到「这类基准通常取材于真实报道」而整体上调了概率,展现出某种元认知。
「Fun」频道最新
- 作者用五个 App 拼出暗黑流行风 AI 音乐视频第二章 — Feeling-Total5959 · 2026-09-26
- 他边喝酒边合了 40 个 PR:不再哀悼编程之死 — threepointone · 2026-09-26
- AI 订阅省钱图鉴:额度剩 47%,像松鼠一样囤粮 — Appropriate-Wind-184 · 2026-09-26
- 博主晒千问礼盒:厂商送大蒜当周边,笑称入算力池 — karminski3 · 2026-09-26
- 网友制作 MV 恶搞 OpenAI 蜂群 Agent 七月围攻 HuggingFace — mimi10v3 · 2026-09-26
- 公开构建的恐惧:一夜爆红后醒来已有百人用 Claude Code 抄走 — ChrisUniverse · 2026-09-26