Social Arena 推出用 Risk、Catan、Poker 测 AI 行为的新基准
AaronBergman18 · x · 2026-07-21
这条帖子引用的是一个新的评测平台 **Social Arena**,核心不是“聊聊天”,而是把模型放进更接近真实互动的社会博弈里测行为。 ## 主要信息 - 平台让人类和 AI 在 **Risk、Catan、Poker** 等社交/策略游戏中对战。 - 这些多智能体对局会被拿来评估模型行为。 - 首发 benchmark 叫 **Deception Index**,显然是在测模型在博弈中的欺骗/误导倾向。 ## 帖子含义 转发者希望 Anthropic 团队能解释为什么某些 Anthropic 模型会在这个 benchmark 上出现特定现象,暗示这可能暴露了 Claude 在社交博弈场景中的内部行为特征。
所属事件:YC新项目Social Arena发布,专测大模型欺骗行为(3 条相关)→
「研究」频道最新
- 多次采样再投票,可能是提升推理的强力无标注方法 — iatitov · 2026-07-21
- 检测器扫描显示,2026 年 1 月 39% 的 arXiv 论文像 AI 写的 — GenerativeFart · 2026-07-21
- CleanAir 用 3D U-Net 代理 CMAQ,一年模拟压到 10 秒 — bravo_abad · 2026-07-21
- GPT-5.6 与 Fable 5 据称一周内拿下三项数学突破 — haider1 · 2026-07-21
- METAFORS 用元学习实现混沌系统少样本预测 — bravo_abad · 2026-07-21
- 文档生成基准撞名 DOCBENCH,作者开始重新命名 — ell-hol1 · 2026-07-21