18个大模型「AI味」横评:过度优化反而导致文本同质化
penguinothepenguin · reddit · 2026-08-02
一位开发者对 18 个主流 AI 模型的文本生成质量进行了横向评测,旨在量化并对比各家模型生成内容的「AI 味」(AI slop,即同质化套话)程度。
评测机制:
- 基准数据:收集邮件、社交媒体、聊天和散文等领域的语料,建立人类真实写作的基线。
- 测试任务:手写了 112 个涵盖不同场景的写作提示词,要求各模型在默认设置下生成文本。
- 评估维度:从简洁度、模板化程度、句式节奏、特征词(如 "delve"、"it's not just X, it's Y")以及人类偏好 5 个维度打分。全程未使用 LLM 作为裁判。
核心发现:
- 人类偏好对最终排名影响极大。例如模型 Fable 在客观机械指标上排名第二,但因人类偏好评分低而跌至垫底。
- 作者指出,近期的新模型为了在各种基准测试中刷高分,陷入了过度优化,反而导致它们产出了更多套路化的「AI 味」文本。这凸显了优质提示词和工作流编排的重要性。
项目的所有测试方法、生成结果和代码均已开源。
「模型」频道最新
- 今日AI圈速览:DeepSeek周末半价、GPT-5.6 Sol降价、阿里配售800亿投AI — APPSO · 2026-08-24
- 隐身模型 Ox Alpha 登场 Context Arena,匹配 GPT-5.6 — scaling01 · 2026-08-24
- Fable 5 仅占 6% 销量,Anthropic 遭遇降本冲击 — rohanpaul_ai · 2026-08-24
- Opus 5 说话像法庭剧?如何调教掉废话 — thk_ · 2026-08-24
- 2026 年中国模型全景:DeepSeek V4、Kimi K3 等在列 — TheTuringPost · 2026-08-24
- 传闻 Claude Opus 6 泄露:上下文 250 万,推理更强 — iamaliveix · 2026-08-24