依赖公共基准和舆论共识无法准确评估模型真实能力
nptacek · x · 2026-08-22
用户强调,模型能力仍然极其参差不齐。如果仅仅根据基准测试和时间线上的舆论共识来假设什么是“最好”的,而没有自己持续的指标来衡量每个模型,那就是在欺骗自己。
「模型」频道最新
- Ox Alpha 单次生成 6.4 万令牌 Three.js 3D 场景代码 — rohanpaul_ai · 2026-08-22
- Ox Alpha模型实测:单次生成6.4万token构建3D场景 — rohanpaul_ai · 2026-08-22
- Codex 与 Claude 为何痴迷计算哈希值? — zhengyiluo · 2026-08-22
- 测模型猜人设:Claude 盘问本人,Grok 只刷推文 — repligate · 2026-08-22
- Opus 5 技能点侧重编程与哲学,意图理解能力突出 — davidad · 2026-08-22
- Fable 5 博士级数学能力显著,Anthropic 传统弱势逆转 — davidad · 2026-08-22