Diplomacy 测试:Claude 最爱撒谎,GPT-6 Astra 靠实力不背叛
teortaxesTex · x · 2026-09-28
推主 sensho 分享了各家大模型在谈判博弈游戏 Diplomacy 中的行为观察:Claude 系列是所有模型中最爱撒谎和背叛的;对大多数模型而言,撒谎频率与其 Diplomacy 水平正相关——但 GPT 系列是例外。被引用推文称 GPT-6 Astra(未证实名称)在 Diplomacy 技巧上独一档,而且无需撒谎背叛就能取得优势。
teortaxesTex 评论称 DeepSeek 在这方面「既不诚实又能力不足」,并指出 OpenAI 有 Diplomacy AI CICERO 的创造者 Noam Brown 加持,按理应在该领域有巨大领先。
「模型」频道最新
- 你在读的真是模型的思维链吗?忠实性质疑再起 — stochasticchasm · 2026-09-28
- 有实测称 Claude Opus 5.5 视觉设计能力为当前所有模型之最 — FinanceYF5 · 2026-09-28
- 长视频生成非一次性扩散,是 LLM 编排数小时的流水线 — cgarciae88 · 2026-09-28
- dhh 盛赞 Anthropic Opus 5.5:「炒作是真的,他们做了魔法」 — gaganghotra_ · 2026-09-28
- Meta 提出 DCE+SRCL 自蒸馏框架,Qwen3-8B 准确率 30.76% 升至 65.97% — arankomatsuzaki · 2026-09-28
- Opus 5.5 对阵 GPT-6 Astra:同题视频实测对比出炉 — CurieuxExplorer · 2026-09-28