LLM 数热量实测:仅 16%-48% 餐食误差低于 20%
mr_tolkien · reddit · 2026-09-07
作者用 Nutrition5k 数据集中的 25 张餐食照片对比多款模型的卡路里估算能力,评估标准为误差低于 20% 的比例。结果:Muse Spark 1.3 最佳(48% 达标,中位误差 45 kcal),DeepSeek v4 Flash Vision 40%,Qwen 3.8 Flash 36%,而 Qwen 3.8 27b 仅 16%(中位误差 148 kcal),被同为 30B 级的 Muse Glimmer 30b(32%)明显碾压。关键发现:排名与模型规模无关联,32GB 显存级「最佳本地模型」高度取决于任务。
「模型」频道最新
- GPT-6 Astra 在对话驱动交互游戏首关就彻底翻车 — msew · 2026-09-07
- GPT 6 Astra 用户过载,平台开始引导用户切换到 5.6 sol — vista8 · 2026-09-07
- 曝 Gemini 3.5 Live 即将推出,或仅限 Pro 订阅用户 — Able-Line2683 · 2026-09-07
- OpenAI Astra 反编译 BIOS 精准写 EC,拿下其他模型搞不定的键盘背光控制 — anom604 · 2026-09-07
- 用户实测称 Astra high 质量更好且周限额消耗更低 — sweetbeard · 2026-09-07
- 放射学「最后考试」实测 Astra,医生称初见 AGI 苗头 — DrDatta_AIIMS · 2026-09-07