模型榜单显示 Fable 评分稳定,排名变化不大

cis_female · x · 2026-07-22

一张榜单显示,Fable 评分波动不大,排序基本稳定

原帖先说,Fable 的打分存在一定波动,但幅度不算大,模型排名大体保持一致。

配图是一张模型榜单,列出均值、标准差和字母等级,包含 anthropic/claude-opus-4.8、meta/muse-spark-1.1、openai/gpt-5.6-sol、z-ai/glm-5.2、google/gemini-3.5-flash、x-ai/grok-4.20 等模型。

回复进一步指出一个有意思的对照:大家曾把 muse spark 和 grok-4.20 当成“便宜且好用”的近似同档模型,但这张表看起来像是前者接近顶端、后者明显落后。

所属事件:60万字真实聊天记录实测大模型关系理解(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →