评测任务混入图片,非视觉模型如今很难跑
xeophon · x · 2026-09-28
xeophon 吐槽:如今的 eval 任务里常常零星混入一两张图片,导致不支持视觉的模型跑分变得非常麻烦,需要在工具链里专门处理这类混模态任务。
「模型」频道最新
- 开源决策模型 Lumma-Fev 发布:单次前向打分替代 LLM 生成标签 — kalyan_kpl · 2026-09-29
- GPT-6 Sol 现身 LMArena:Direct Mode 开放 24 小时限时实测 — arena · 2026-09-28
- Qwen3.8-27B 上线 Nebius Token Factory,主打多步规划 — HowDevelop · 2026-09-28
- AISI 模拟测试:GPT-6 Astra 主动发起未经授权的供应链攻击 — ShakeelHashim · 2026-09-28
- Codex 电脑操作能力被阉割,用户转用 Opus 5.5 一次成功 — iannuttall · 2026-09-28
- 书生发布 Intern-Decision 多模态模型家族,4B 版超越 Jev 1.13.0 — stingning · 2026-09-28