MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes
Remco Hendriks
Continker
cs.LG, cs.AI, cs.CL
2026-09-09
MetroLLM-Bench 用 955 道真实地铁售票案例测 26 个模型。4B Qwen 经 PEFT 后 held-out Tier 1 得 91.3,超过两个 GPT-5.6 档、打平 GPT-5.4;同一配方下 9B 与 27B 学生没有再涨,规则脚本基线只到 84.6。
地铁售票机把票价规则、线网拓扑、故障应对写成程序化状态机。运营方要反映一次封站、一个新票价档、一份节假日时刻表,通常要走开发工单、集成补丁、回归测试、发版窗口。规则常变,算错一次就是账单错误,这条代码链路的成本是具体的。
MetroLLM-Bench 测另一条路:策略层换成语言模型。模型读一份自然语言系统说明(framebook,里面是术语、币种、运营时段、文化约定),在最多 20 轮的 ReAct 循环里调用结构化工具,最后提交一份机器可渲染的终端状态:结局、适用时的按票报价、告示条、售票机动作。屏幕槽位是固定的,动作必须能被硬件执行,运营方还要能解释售票机为什么这么做。
六个真实系统拉开了必须吸收的差异:亚特兰大 MARTA 38 站、多哈地铁 37 站、旧金山 BART 50 站、台北捷运 107 站、芝加哥 CTA 142 站、北京地铁 414 站。三种票价模型,四种货币。955 道案例分成十一类:路径、票价、中断、无障碍、文化、政策、多轮、对抗、时间推理、工具幻觉、复合压力。系统分层 75/25 切分在训练前锁定,717 道只用来造教师轨迹,238 道 held-out 评测。
六个工具是 routeplanner、farecalculator、stationinfo、lineinfo、disruptionfeed、knowledgebase。提交必须落到五个结局之一,结构由 Pydantic 校验;不一致就返回 HTTP 422,模型可以在剩余轮次里改。prompt 和工具结果按设计给出案例所需的全部运营事实,测的是跟规则走,不是从预训练里背线网。
打分分两层。Tier 1 十四条全是确定性的:路径和票价对不对、有没有幻觉工具、状态能不能渲染、结局与原因码、票价拆分、购买闸门、中断检测、重规划效率等。这一层干净到可以直接当 PEFT 奖励。Tier 2 八条语义质量,其中六条用 Claude Haiku 4.5 当裁判。对外同时报 Tier 1,以及两层合计的 composite。
微调配方收得很窄。教师是 Qwen 3.5 的 27B 稠密和 35B-A3B,只在训练分区上跑,留下 Tier 1 至少 90% 的轨迹,按案例去重后 600 条,均值 99.0。四个学生 2B、4B、9B、27B 共用 QLoRA rank 16、三轮、有效 batch 8。27B 受 32GB 显存限制,最大序列从 4096 砍到 2048。九次训练合计 9.4 GPU-小时,一张 RTX 5090。
held-out 238 道上,composite 第一是 Muse Glimmer 30B,92.03,Tier 1 为 92.75。Qwen3.6-27B 的 Tier 1 最高,93.63。有部署含义的是 4B PEFT 学生:Q4KM 体积 2.6GB,Tier 1 91.32,超过 GPT-5.6 luna 的 90.63 和 sol 的 90.00,和 GPT-5.4 full 最大推理力度的 91.37 只差 0.05,落在配对 bootstrap 区间里。
| 模型 | held-out Tier 1 | composite |
| Muse Glimmer 30B | 92.75 | 92.03 |
| Qwen3.6-27B | 93.63 | 91.28 |
| GPT-5.4 full (xhigh) | 91.37 | 90.45 |
| Qwen 3.5 4B + PEFT | 91.32 | 89.12 |
| GPT-5.6 luna | 90.63 | 90.57 |
| 规则脚本基线 | 84.6 | 77.1 |
PEFT 相对同尺寸基座的增益随尺寸单调下降:2B +7.03(三个种子),4B +2.00,9B +1.65,27B −0.91。每个尺寸每个种子方向一致。4B、9B、27B 三个学生的 held-out Tier 1 落在 91.03 到 91.41,只差 0.38。规则脚本按固定顺序串工具,路径 composite 93.5、票价 91.7,已经接近模型;时间推理掉到 52.1,无障碍 69.7,政策 73.3。语言模型多出来的分,集中在要做决策的类别。
服务配置本身能改排名。统一 greedy、4096 token 输出预算时,Qwen3.8-27B 比 3.5 低 3.60 个 Tier 1 点;抬预算再换成厂商推荐采样,大约 2.7 点是配置。论文因此按各模型自己最好的配置排行,选择乐观没有另定量。
裁判校准一般:作者与 Haiku 的加权 κ 是 0.53,两个标注者之间只有 0.25。headline 比较全部落在确定性 Tier 1。
对要在本地跑窄任务 agent 的人,这篇给了一个可复现的对照。任务边界收得够紧时,2.6GB 开源权重加 PEFT,就能在可执行合同上打平前沿 API。权重、adapter、prompt、工具、推理都可以留在运营方自己的栈里。
它对 PEFT 的边界也很清楚。基座已经够强时,同一套 600 条轨迹、rank 16、三轮的配方不但不再涨,27B 在全量 955 道上显著掉分。未适配的 27B 基座仍是四个尺寸里最强的。结论不是小模型天生更好,是加容量和加 adapter 对已经胜任的基座不必有帮助。
案例、harness、规则基线和四个学生都已公开。
任务被故意收窄:六个工具、通常三到七次调用、输出是受约束的终端状态。时间推理上 GPT-5.4 xhigh 仍高 13.7 个 composite 点,87.2 对 Qwen 27B 基座的 73.5;对抗类也是前沿模型占优。4B 学生在 composite 上落后 GPT-5.6 luna 和 GPT-5.4。把「打平」外推到更宽动作空间或更长地平线,数字不支持。
统计上 held-out 只有 238 道,四组主比较的配对区间都含零;全量矩阵上 4B 增益和 27B 回退才显著。前十一名 composite 只差 3.18 点,和单次运行的噪声带宽相当,顶端排行分不出真正名次。绝大多数非 PEFT 模型只跑了一次,OpenAI 行还被迫用 temperature 1.0。
27B 学生用了更短的 2048 序列,掉分可能混进这个硬件约束。教师和四个学生是同一家族。案例自 2026 年 6 月 19 日公开,Muse Glimmer 和 Qwen3.8 在那之后发布,污染无法从公开文档里排除。全部回答是英文,包括非英语系统。评测不覆盖支付、辅助硬件、PII、端到端时延。framebook 和案例由一名作者在 AI 辅助下写成,答案键还留了几处已知缺陷未改,以免中途改评测集。