60万字真实聊天记录实测大模型关系理解
近期,一组针对大模型“关系理解”能力的评测在社区引发关注。评测者 @cisfemale 将自己与朋友过去一年约 60 万 token 的真实聊天记录喂给多个模型,要求它们围绕具体问题评论这段关系,再交由 Fable 5 进行打分。该评测引入了成本数据来横向对比各模型的性价比,为评估模型在实际情感与关系场景中的表现提供了新视角。
评测机制与排名
评测结果由 Fable 5 进行评分。@cisfemale 表示,虽然打分存在一定波动,但幅度不大,模型排名大体保持一致。在结合了成本数据的性价比榜单中,Claude Fable 5 以 4.30 分领跑,Claude Opus 4.8 紧随其后。此外,各模型单次任务成本对比覆盖了 Claude、Mistral、Qwen、GPT、Gemini、GLM、Kimi、DeepSeek 等多家主流产品,价格跨度从 2.75 美元到 0.02 美元不等。
性价比争议与数据勘误
在横向对比中,Meta Muse Spark 1 表现接近最佳,且在性价比上明显压过 Grok-4.20。@cisfemale 指出,此前业界常把这两款模型视为“便宜且效果差不多”的选择,但实际评测显示 Grok-4.20 的表现明显更差。此外,@cisfemale 后来发布勘误,提醒读者其在部分图表中将成本数字写错了,正确的成本数据应以另一张图表为准。
2026-07-20 ~ 2026-07-22 · 6 条相关
一手来源
- 一份 60 万 token 关系测试在比模型理解私密上下文的能力 — cis_female ·
- 一张模型榜显示 Muse Spark 在性价比上远超 Grok-4.20 — cis_female ·
- Fable 5 评测 Sophia 关系理解结果,作者修正成本数字 — cis_female ·
- 各模型单次任务成本对比 — Scobleizer · 2026-07-20
- 【源头】一份 60 万 token 关系测试在比模型理解私密上下文的能力 — cis_female · 2026-07-21
- 补充评测显示 Muse Spark 明显压过 Grok-4.20 — cis_female · 2026-07-21
- 【源头】一张模型榜显示 Muse Spark 在性价比上远超 Grok-4.20 — cis_female · 2026-07-21
- 【源头】Fable 5 评测 Sophia 关系理解结果,作者修正成本数字 — cis_female · 2026-07-22
- 模型榜单显示 Fable 评分稳定,排名变化不大 — cis_female · 2026-07-22