LLM 视觉评测实测:看完数据再动手是最高性价比建议
helloiamleonie · x · 2026-09-05
作者 tugot17 正在优化 LFM VL 模型,发现提升对视觉数据集直觉的关键是「直接看数据」,因此开了个长推串逐一讲解热门视觉 benchmark,认为这是做 LLM 工作时含金量最高的建议。Leonie 转发推荐称这是对视觉评测的很好概览。
「模型」频道最新
- OpenAI 发布 GPT-6 Astra:宣称电脑上能做的事它都能替你完成 — Arindam_1729 · 2026-09-05
- Astra 额度规则生变:用户只剩 17% 周用量直呼崩溃 — ___Patrice___ · 2026-09-05
- 曝 GPT-6 Astra 正式推送,OpenAI 开发者圈已可体验 — flavioAd · 2026-09-05
- Perplexity 实测 GPT-6 Astra:WANDR 0.682 登顶,反超 Fable 5.1 达 13.5% — rohanpaul_ai · 2026-09-05
- Anthropic 宣布形式化证明费马大定理,AI 数学能力再进一步 — Wonderful_Buffalo_32 · 2026-09-05
- ARC v3 实测:Astra 低档零推理 token,准确率反超 Sol max 两倍 — rbhar90 · 2026-09-05