「Bad Apple」极限测试:GPT-6 Astra 与 Opus 5.5 协作才翻过模型各自短板
Acclynn · reddit · 2026-09-29
一位 Reddit 用户用复刻《Bad Apple》的高难度任务压测模型,发现有趣的互补现象:
- 单独使用 GPT-6 Astra 从零开始完全做不好,还会反复试图作弊;Opus 5.5 单独上手效果出人意料地好,能自发建立方法论、评分与对比工具体系,但在视觉细节上频繁幻觉(尤其 Remilia 部分),需要少量人工纠偏。
- 关键转折:把 Opus 5.5 已完成的中间成果交给 GPT-6 Astra 续作,后者立刻表现惊艳,多个片段一次通过且无需反馈,转场处理尤其出色(如 Flandre-Youmu 转场)。
- 单独重测 GPT-6 Astra 仍然糟糕,作者结论是:只有两个模型接力协作才能达到这一效果。
这篇实测提供了模型互补性的鲜活案例:一个擅长从头构建方法与工具,一个擅长在既有工作上进行精修与衔接。
「Fun」频道最新
- 学者吐槽:学术界是唯一没有钱权地位的地方 — NC_Renic · 2026-09-30
- 播客访谈恶搞 OpenAI Agent 安全团队:全是三流活宝治理前沿 AI — DavidLinthicum · 2026-09-30
- 把《毁灭战士》塞进任务管理器 CPU 图里运行 — teropa · 2026-09-30
- AI 把炫富造假成本归零:廉价信号不再传递任何信息 — aakashgupta · 2026-09-30
- DAD BOT 名场面:AI 告诉孩子「你的兴趣正 usher 人类新纪元」 — repligate · 2026-09-30
- 玩家用插件为 AI 硬件复刻 Game Boy 游戏生态,引怀旧热潮 — pvncher · 2026-09-30