EQ-Bench 创意写作榜单引入 Slop Score 评估模型风格
sam_paech · x · 2026-08-25
用户讨论了 EQ-Bench 创意写作 v3 排行榜,该榜单用于评估大语言模型的情感智力。新引入的 Slop Score 指标通过匹配主列表中的高频词/短语(如 "GPT-isms")来衡量模型输出的陈词滥调程度。榜单还提供了 Repetition 指标来衡量输出重复性,并支持查看模型的详细风格 Profile。
所属事件:EQ-Bench 创意写作榜单新增 Slop Score 评估指标(2 条相关)→
「模型」频道最新
- 基于 Tokenization 分析确认某模型源自 GLM — peterjliu · 2026-08-25
- Arcee AI 基座模型实测:5.6 Pro 表现依然惊艳 — code_star · 2026-08-25
- DeepSeek R1 被指通过 Claude 轨迹“作弊”提升性能 — teortaxesTex · 2026-08-25
- DeepSeek Flash Vision 登顶开源模型,成本仅为 Kimi K3 十分之一 — bindureddy · 2026-08-25
- 本地党盛赞 Qwen 是代码怪兽,DeepSeek 缺 UI 感知还占卡 — tat_tvam_asshole · 2026-08-25
- 知情人士称下一代模型将引发「本体论冲击」 — Neurogence · 2026-08-25