一份 60 万 token 关系测试在比模型理解私密上下文的能力

cis_female · x · 2026-07-21

作者把自己和一位朋友过去一年大约 60 万 token 的聊天记录喂给多个模型,要求它们围绕一些具体问题评论这段关系,再由 Fable 5 进行评分。

这条帖子本身主要是在展示这套“关系理解”评测的结果入口,附图里给出了各模型的分数与排名。

所属事件:多模态大模型横向评测聚焦性价比与上下文理解(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →