多模态大模型横向评测聚焦性价比与上下文理解

近期多项大模型评测聚焦于任务成本与复杂上下文理解能力。一项测试将约 60 万 token 的聊天记录输入多个模型,由 Fable 5 评估其对私密关系的理解。结合成本数据的综合榜单显示,Claude Fable 5 以 4.30 分领跑,而 Muse Spark 在性价比上显著超越 Grok-4.20 等模型。

2026-07-20 ~ 2026-07-21 · 4 条相关