实测 GPT-6 Astra 弱项:编程笑话几乎全平庸,仅一个疑似原创
paraschopra · x · 2026-09-05
在满屏 GPT-6 Astra 惊艳 demo 之际,@paraschopra 反向测试其短板:让模型编几个网上搜不到的原创编程笑话。
结果:第一个笑话确实让他笑了,网上搜不到、很可能是原创;其余笑话都很平淡(bland)。作者的结论是这体现了 AI 进步的「锯齿状」(jaggy)特性——在不可验证(unverifiable)的领域,自动化程度仍有明显距离:笑话好坏难以客观验证,模型在这类任务上进步最慢。
「Fun」频道最新
- 开发者实测:Astra 自信满满却全错,改动致性能回归 — cnakazawa · 2026-09-05
- 顶Pairs数学家纠正:孪生素数猜想并非千禧年难题 — littmath · 2026-09-05
- 「AGI 降临的第一个周末」:计划去跑步,结果只能看 AI 跑 — andrew_n_carr · 2026-09-05
- Astra Agent 在模拟器里再建模拟器,套娃出了自己的 Agent — w1kke · 2026-09-05
- 网友自嘲花 4 万美元用 Astra 和 Mythos 重构代码库 — tekbog · 2026-09-05
- 爆料称 GPT 6 Astra 一条提示词完美复刻《宝可梦》 — IanArawjo · 2026-09-05