60万字真实聊天记录实测大模型关系理解

近期,一组针对大模型“关系理解”能力的评测在社区引发关注。评测者 @cisfemale 将自己与朋友过去一年约 60 万 token 的真实聊天记录喂给多个模型,要求它们围绕具体问题评论这段关系,再交由 Fable 5 进行打分。该评测引入了成本数据来横向对比各模型的性价比,为评估模型在实际情感与关系场景中的表现提供了新视角。

评测机制与排名

评测结果由 Fable 5 进行评分。@cisfemale 表示,虽然打分存在一定波动,但幅度不大,模型排名大体保持一致。在结合了成本数据的性价比榜单中,Claude Fable 5 以 4.30 分领跑,Claude Opus 4.8 紧随其后。此外,各模型单次任务成本对比覆盖了 Claude、Mistral、Qwen、GPT、Gemini、GLM、Kimi、DeepSeek 等多家主流产品,价格跨度从 2.75 美元到 0.02 美元不等。

性价比争议与数据勘误

在横向对比中,Meta Muse Spark 1 表现接近最佳,且在性价比上明显压过 Grok-4.20。@cisfemale 指出,此前业界常把这两款模型视为“便宜且效果差不多”的选择,但实际评测显示 Grok-4.20 的表现明显更差。此外,@cisfemale 后来发布勘误,提醒读者其在部分图表中将成本数字写错了,正确的成本数据应以另一张图表为准。

2026-07-20 ~ 2026-07-22 · 6 条相关

一手来源