一份 60 万 token 关系测试在比模型理解私密上下文的能力
cis_female · x · 2026-07-21
作者把自己和一位朋友过去一年大约 60 万 token 的聊天记录喂给多个模型,要求它们围绕一些具体问题评论这段关系,再由 Fable 5 进行评分。
这条帖子本身主要是在展示这套“关系理解”评测的结果入口,附图里给出了各模型的分数与排名。
所属事件:多模态大模型横向评测聚焦性价比与上下文理解(4 条相关)→
「模型」频道最新
- Google 将 Gemini 3.6 Flash 定位为最强智能模型 — scaling01 · 2026-07-21
- Soofi S 30B-A3B 发布完整预训练报告,称英德双语开源领先 — abursuc · 2026-07-21
- pi 0.81.0 增加对 llama.cpp server 的一等集成 — huggingface · 2026-07-21
- GPT-5.6 Sol 被指比 Opus 4.8 更会解释错误观点 — eyishazyer · 2026-07-21
- 爆料称 Gemini 3.5 Pro 拿到 200 万上下文和更强编程 — bdsqlsz · 2026-07-21
- Mollick 说 AI 文风像不像,关键不在破折号和列表 — emollick · 2026-07-21