FlavourBench:用可执行基准评测前沿大模型
Josef Chen · hf · 2026-08-24
FlavourBench 是一个新的评测基准,通过可执行的真实答案、统计严谨性和完全可复现的验证机制,对语言模型在烹饪任务上的表现进行排名和评估。
「研究」频道最新
- AutoSaddler 自动修复 Agent 框架,SWE-Bench 提升近 10 分 — omarsar0 · 2026-08-25
- 致敬生成式研究:扩散、分数匹配与流匹配 — ariG23498 · 2026-08-25
- AI 生产率为何迟迟不爆发?J 曲线论文:无形互补投资拖慢增长 — robseamans · 2026-08-25
- 文档长度影响算法效率,长文本场景下 token pooling 优势显现 — tomaarsen · 2026-08-25
- 相变即算力:里德堡原子蒸气在临界点附近变身更好的计算机 — bravo_abad · 2026-08-25
- 免费电子书:《贝叶斯工作流》发布 — RexDouglass · 2026-08-25