FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents
Tianyou Wang, Chongyang Gao, Kezhen Chen, Chen Dong, Yinghao He, Donghan Li, Wangcheng Xu, Hongjiu Zhang, Chi Li
cs.AI
2026-08-19
FM-Bench让15个前沿模型各管一家足球俱乐部20个游戏年。claude-fable-5单人赛90.94、竞技场76.26居首;token消耗与排名无关,无人从拒单里学会市场价格。
现在的agent基准大多是短地平线:修一个GitHub issue、串几步工具、在网页上完成一项交付。环境几乎不还手,错误很少跨年累积,旁边也没有抢同一资源的对手。Vending-Bench、创业模拟把时间拉长了,对手仍是脚本或回放市场。管理要的是另一件事:信息不完整、后果跨季兑现、对手会针对你暴露出的策略加价,成绩和财务还被董事会一起打分。
FM-Bench把这件事做成一个确定性的足球经理引擎。每个agent管16支职业队里的一支,20个游戏年,大约340到400个决策停顿,26个工具。选秀预算大家一样,球员真实能力永久隐藏在带偏差的球探区间后面。转会市场会因拒单抬高隐藏要价,对同一对手反复杀价会加价。董事会按战绩和财务纪律联合打分,破产或被炒不会结束计量,最多三次折价复活。每个停顿开一场全新对话,跨停顿唯一能带的状态是agent自己写的笔记本,记忆策展本身就是被测能力。打分由引擎累加荣誉、实际增值和阵容价值,没有LLM裁判,也没有人工打分。
两条赛道共用一个引擎。单人赛:一个被测模型对15个分级脚本对手。竞技场:15个模型加一个脚本锚在同一世界里抢人,密封出价、等额禀赋、折价复活,用来去掉座位混淆。对照包括能读隐藏状态的oracle脚本、纪律型盲脚本、空仓和随机。六名首次游玩的人类跑同一条单人赛。
15个模型在三个种子上全部跑完20年。盲脚本锚大多数死掉:启发式均分17.05,空仓-0.90,随机-17.21。单人赛oracle 95.54±4.68,claude-fable-5以90.94±5.20、24M token居首,约oracle的95%。开源kimi-k2.6以88.49±0.15排第二,方差极小。gpt-5.6-terra 86.66压过同门gpt-5.6-sol的86.40。claude-haiku-4.5只有36.90±22.73,种子间能垮二十多分。规模、标价、厂商都排不出这个顺序。token与得分的Spearman相关是-0.19。第5年排名和第20年相关只有0.19,deepseek-v4-pro前十年领先,最终第12。更短的地平线会排出另一张表。
行为分解里,和得分同向稳定相关的是三件事:临近终点减少回收慢的设施和青训投入(rs=-0.58),现金不要堆成闲置(rs=-0.50),合同到期前提早续约(rs=+0.45)。价格发现全场失败:oracle一次成交,场上中位数30次报价才签下一个人,最好的Fable也要9次,gemini-3.5-flash要73次。笔记本裂成两种失败:gpt-5.6-sol相似度0.91,只追加不删;claude-sonnet-5是0.20,每季把计划整页重写。Fable停在0.39。人类六人里四人出局,最强完赛74.64,刚到模型榜尾。
竞技场上Fable 76.26仍第一,muse-spark-1.1 62.47第二。冠军在十个模型间轮转,卫冕只保住2/19次换季。脚本锚第3年出局。Fable单人赛每季0.5次报价,竞技场升到4.6次。claude-opus-4.8在笔记本里写过该把闲钱换成年轻球员,终场仍握着约2,100M闲置现金。知道和做到是分开的。
这是目前少有的、把长地平线和对手适应性绑在同一套机制分上的agent评测。它直接打脸「更大、更贵、更肯花token就更会管事」。对要部署长期agent的人,可迁移的信号很具体:会不会在终点前收慢回报投资、会不会让现金躺着、会不会在合同爆炸前动手、笔记本是档案还是每季重写。记忆策展和价格学习是两条所有模型都没过的线,比再刷一个短任务分数更值得做。
竞技场主文只报一个种子,座位排序对世界随机性有多稳,并不清楚。Oracle是特权脚本不是最优控制,95%这个比例不能读成「快到天花板」。模型名单是2026年7月的旗舰快照,含未广泛外测的内部名,跨论文难复现。足球规则和球探偏差是作者校准的,换一个经营域,能力排序可能动。六名人类都是首玩,和模型的「专家对专家」不是同一口径。引擎没有真实球员姓名,防的是记忆泄漏,也去掉了真实球市里的品牌溢价。