EQ-Bench 4 发布:多轮对话实测大模型情商

全新的基准测试 EQ-Bench 4 正式发布,专注于评估大语言模型的应用情感智能与社交对齐能力。该测试摒弃了单一的标准答案,通过模拟具有对抗性特征和多样化的用户画像,与模型展开长达 16 轮的复杂多轮对话。此举旨在深入考察 AI 在复杂交互情境下的情商表现及应对冲突的能力。

2026-07-24 ~ 2026-07-24 · 3 条相关

另有 1 条近重复转述:sam_paech