LLM 数热量实测:仅 16%-48% 餐食误差低于 20%

mr_tolkien · reddit · 2026-09-07

作者用 Nutrition5k 数据集中的 25 张餐食照片对比多款模型的卡路里估算能力,评估标准为误差低于 20% 的比例。结果:Muse Spark 1.3 最佳(48% 达标,中位误差 45 kcal),DeepSeek v4 Flash Vision 40%,Qwen 3.8 Flash 36%,而 Qwen 3.8 27b 仅 16%(中位误差 148 kcal),被同为 30B 级的 Muse Glimmer 30b(32%)明显碾压。关键发现:排名与模型规模无关联,32GB 显存级「最佳本地模型」高度取决于任务。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →