FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth
Josef Chen, Erim Hayretci
cs.AI, cs.CY, cs.LG, cs.SE
2026-08-21
FlavourBench把Epicure厨味运行时编成三选八题目,56个组合预先打0–100分,27个模型在同一534题核心上比。Grok 4.6得分65.1,351对里只有101对统计可分,两套独立题板相关r=0.89。
开放式语言模型评测几乎总要继承一个裁判:人类偏好、另一个模型,或者脆弱的精确匹配。裁判和被测系统缠在一起,精确匹配又把「还行」和「很差」打成同一类错。代码可以跑测试,数据库可以检查状态,游戏可以计分。烹饪推理通常做不到这些。
FlavourBench把一个版本化的烹饪运行时变成可执行环境。Epicure用300维空间表示1790种食材,提供替换、搭配、膳食可行性、地域组合等确定性操作。它不是人类口味的满分答案,也不是排行榜上的参赛模型,它定义的是任务奖励面。测的是模型和这份已发布环境的一致程度。
每道题给8个候选食材,要求选出3个组合,共56种可能。跑模型之前,Epicure给全部组合打原始效用,再在题内做min-max归一化到0–100,最优组合永远是100。无效组合(膳食或品类约束)直接0分。
排行核心534题,来自两个独立编译的题板,三个决策族各178题:
| 题族 | 决策 | 效用构成 | 随机基线 | 最优–次优中位差 | 不同分数个数 |
| 替换 | 给锚点找三件替代 | 0.8相似+0.2组合内聚 | 45.2 | 5.6 | 56 |
| 搭配 | 给锚点配三件伴食 | 0.65亲和+0.35内聚 | 45.0 | 5.6 | 56 |
| 约束 | 膳食+NOVA上限下的可行组合 | 0.7相似+0.3内聚 | 3.4 | 37.3 | 4 |
约束题刻意稀疏:不可行就是0。地域组合题作为补充轨发布,没进27模型主榜,因为凑不出同样完整的公共核心。
提示要求最后一行以FINALSELECTION开头,三个A–H标签。解析器只看这一行,做一次查表。解释性文字不影响分数。Epicure在评测时不作为工具暴露,测的是模型自己会不会做烹饪决策。
27个端点覆盖OpenAI、Anthropic、Google、xAI到Cohere。每家必须在每个题板×题族上交出89道可解析回答,共14418个格子。任务是否进入公共核心只看响应状态和解析,先固定题ID再加载分数。有推理力度旋钮的端点,隐藏思维链不计入,力度固定到运输稳定的最低档。
分数是六个层(2题板×3题族)的等权平均。推断用5万次锚点簇bootstrap给同时95%区间,10万次符号翻转检验351对,Holm控制。同一锚点食材跨题板一起移动。
Grok 4.6点估计最高,65.1,同时95%区间[61.0, 69.2],bootstrap排名区间[1, 5]。前排挤在一组里,不能把相邻名次读成已分胜负。
| 名次 | 模型 | 分数 | 同时95% CI | 推断组 |
| 1 | Grok 4.6 | 65.1 | [61.0, 69.2] | 1 |
| 2 | Gemini 3.1 Pro | 65.0 | [60.8, 69.1] | 1 |
| 3 | GPT-5.6 Sol Pro | 64.2 | [60.1, 68.4] | 1 |
| 26 | Llama 4 Maverick | 53.7 | [49.6, 57.7] | 3 |
| 27 | Command R+ | 47.9 | [43.7, 52.0] | 3 |
351对里Holm后仍显著的有101对。组1从Grok 4.6一直覆盖到GLM 5.3(60.6);组3只有Llama 4 Maverick和Command R+。两套独立题板的模型分数Pearson r=0.89,秩相关ρ=0.80。
分族能拆开总分相近的模型。Kimi K3搭配73.7是全场最高,约束只有47.0;Gemini 3.1 Pro替换69.0、搭配71.6,约束54.2。约束族把不可行组合直接打零,区分度最大。随机基线在替换和搭配约45分,约束只有3.4分,所有上榜模型都远高于约束随机线。
一个替换题的例子:替代boursin cheese,高分模型选caciocavallo、fromage blanc、grana padano得100,低分模型选fromage blanc、鹌鹑蛋、鹅蛋得15。连续分比精确匹配有用,因为两个非最优组合的厨用效用可以差很多。
给评测的教训比给厨师的多。可执行环境、完整矩形矩阵、事先冻结的分数图、多重比较控制,这套流程可以直接借到其他「有模拟器、没有唯一标准答案」的领域。分数图还能当训练信号:监督最优组合、成对偏好、离线策略优化都有确定奖励。论文没做训练实验,但把环境、奖励和锚点ID都放出来了,下一步可以在开发图上训练、在留出锚点上测迁移。直接在公开测试图上优化,测到的是记忆。
对排行榜读者:Grok 4.6和Gemini 3.1 Pro差0.1分,同时区间完全重叠,写成「第一」超过统计支持。Command R+的排名区间是[27, 27],这倒是分干净的垫底。
作者写得很清楚。FlavourBench分数是与某一版Epicure的一致程度,不是人类口味的黄金标准。题内min-max让0–100可比,但丢掉了原始效用的绝对幅度。任务是受限的三件套选择,不是完整菜谱、感官执行、安全建议或长程厨房规划。公共核心要求所有端点都完成,估的是大家都答得出的题,难解析或被拒的题被拿掉了。结果绑定特定路由和采集日期。密集奖励面支持学习实验,这篇没有测优化Epicure奖励会不会迁到人类烹饪结果。
独立研究者加帝国理工,题面和奖励都来自同一套Epicure嵌入。如果前沿模型在预训练里见过类似食材共现,分数可能部分反映语料重合。论文没有报告与人类厨师偏好的相关。约束题只有4个不同分数,这一族更像可行性分类,和另外两族的细粒度语义不是同一件事。