模型榜单显示 Fable 评分稳定,排名变化不大
cis_female · x · 2026-07-22
一张榜单显示,Fable 评分波动不大,排序基本稳定
原帖先说,Fable 的打分存在一定波动,但幅度不算大,模型排名大体保持一致。
配图是一张模型榜单,列出均值、标准差和字母等级,包含 anthropic/claude-opus-4.8、meta/muse-spark-1.1、openai/gpt-5.6-sol、z-ai/glm-5.2、google/gemini-3.5-flash、x-ai/grok-4.20 等模型。
回复进一步指出一个有意思的对照:大家曾把 muse spark 和 grok-4.20 当成“便宜且好用”的近似同档模型,但这张表看起来像是前者接近顶端、后者明显落后。
所属事件:60万字真实聊天记录实测大模型关系理解(6 条相关)→
「模型」频道最新
- 网友热议 DeepSeek 新模型:K3 还是缩水版 K3-Flash? — teortaxesTex · 2026-09-11
- DeepSeek 新版多轮改 System Prompt 不再击穿缓存,费用省 36.6% — teortaxesTex · 2026-09-11
- AI Sextet 活动:6 模型 14 天完全免费,含 DeepSeek/Qwen/GLM — airesearch12 · 2026-09-11
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11