SimuVerity: Benchmarking Agents for Engineering-Grade Simulink Model Generation
Ruiqi Zhang, Jiahao Wang, Mingxuan Li, Haichen Luo, Chaoting Wang, Guoyu Mou, Keyu Lai, Hanchao Lv, Jiaxu Wang, Yibo Zheng, Aijun Yang, Xiaohua Wang
cs.SE, cs.AI, cs.LG
2026-10-02
SimuVerity 用十个工程领域共 101 道可执行 Simulink 题评测六套 agent,先过交付、运行和合格三道门,再打六维工程分,最强的 Opus 4.8 总分只有 42.86,参考系统均分 96.01。
Simulink 是工业里做动态系统建模和控制设计的图形化仿真环境。LLM agent 已能按自然语言写出可运行的 .slx,再仿真、再改。现有评测大多只查交付、能否编译运行,以及框图像不像参考模型。
能跑只说明工具链没报错。结构相似把一种实现当成唯一标准,会漏掉结构不同但合格的做法,也会放行长得像、行为错的模型。汽车方向已有需求级测试,但多停在软件逻辑,盖不住电力电子、流体、电池和航空航天。
西安交通大学的 SimuVerity 有 101 道文本生成可执行模型的题,十个领域各 9 到 11 题。
每题有一套原生可跑的参考系统。专家跑完后写下可执行系统画像,记下边界、接口、机理、控制关系、工况和动态。公开规格和四类测试都从画像来。题面写系统、接口、工况、机理和动态,不规定用哪些块。倾转旋翼垂直起降要同时保住悬停、带风过渡和航点飞行,框图可以另起一套,只要行为过关。
595 个原生场景分四类:工况包络 205,交互与故障 189,时间过程 79,机理与因果核查 122。评分先过三道门:交出 .slx;原生加载、更新、编译、仿真都通过;工程合格门 G 确认功能角色、信号通路和可评证据都齐。没过门的题按 0 分计。过关后打六维,0 到 100。A 是目标准确度,Q 是输出质量,M 是机理保真,C 是控制与因果完整性,R 是工况域鲁棒性,D 是动态响应与恢复。C 只用于 35 题,M 用于 93 题,D 用于 98 题,A、Q、R 覆盖全部 101 题。
总分等于门控乘上加权几何平均,某一维很差不会被其他高分盖住;部分任务按最坏工况聚合。场景、阈值和评分脚本对 agent 不可见,参考模型目录也隔开。每题从干净会话独立跑三次再平均。
六套系统同题测试,取三次运行的平均。参考系统均分 96.01。
| 系统 | 总分 | 交付 | 可执行 | G 通过 |
| Opus 4.8 + Claude Code | 42.86 | 94.72% | 86.47% | 76.90% |
| GPT-5.5 + Codex | 41.72 | 98.68% | 94.72% | 75.58% |
| DeepSeek-V4-Pro + Claude Code | 28.40 | 97.03% | 88.12% | 61.39% |
| Qwen3.8-Max + Claude Code | 25.01 | 89.77% | 80.86% | 53.80% |
| GLM-5.3-Flash + Claude Code | 4.98 | 96.04% | 48.18% | 13.20% |
| Qwen3.8-27B-FP8 + Claude Code | 1.60 | 30.36% | 13.53% | 6.27% |
| 参考系统 | 96.01 | 100% | 100% | 100% |
Opus 4.8 配 Claude Code 总分 42.86,95% 区间 [37.03, 48.73]。GPT-5.5 配 Codex 为 41.72,区间 [35.29, 48.31],配对 p=0.86,两家分不开。DeepSeek-V4-Pro 28.40,Qwen3.8-Max 25.01,GLM-5.3-Flash 4.98,Qwen3.8-27B-FP8 1.60。四档之间相邻差异显著,p 不超过 0.012,档内不显著。
交付、可执行、G 通过率,Opus 为 94.72%、86.47%、76.90%,GPT-5.5 为 98.68%、94.72%、75.58%。全部运行合在一起是 84.43%、68.65%、47.85%。交得出、跑得动,仍可能过不了合格门。
六套系统端到端六维拉平:A 29.03,Q 38.46,M 31.99,C 29.21,R 27.69,D 27.82。Q 最高,R 与 D 最低。Opus 的 Q 端到端 63.24,过 G 后 82.21;R、D 过 G 后仍是 60.73 和 58.65。
Opus 的领域分两截。电力电子总分 25.99,G 通过率 44.44%,卡在合格门。电池 G 通过率 86.67%,过关后只剩 38.29,卡在合格之后。
结构相似当不好代理。Opus 首轮交付的 95 个模型,贴近参考 39、部分相似 43、结构不同 13,后两类占 58.95%。端到端均分 52.13、44.05、42.37,过 G 后 59.80、52.61、61.20。前四分位 24 个里,12 个并不贴近参考;贴近参考的有 7 个得 0 分,2 个还过了 G。结构不同的两例,装载机协调 85.10,电动飞机动力 80.07。
工程分至少 70 的 31 个 Opus 模型里,8 个框图严重杂乱。只改块位置和已有走线、不改实现,块重叠都收到 0,线交叉密度的降幅为 22.7% 至 85.1%。
10 道 Opus 已能做好的跨域题上,完整 MCP 总分 78.46。关掉仿真反馈掉到 7.88,相差 70.58 分,交付、可执行、G 通过率从全满掉到 53.33%、33.33%、13.33%,十题全降。去掉 MCP、只留批处理,总分 18.23,十题里八题变差。
两名专家盲评 Opus 首轮 30 个模型,加权 Cohen's κ 为 0.90,与专家均分的 Spearman ρ 为 0.94,专家之间 0.87;去掉零分后 18 个模型仍有 0.88。
头名能交出 94.72% 的模型,总分仍只有 42.86,参考系统是 96.01。停在「能跑」会把工程能力看高。
结构远近不适合当奖励。过 G 之后,结构不同的模型均分并不更低。仿真自检更难省,同一批已经做对的题拿掉之后会掉到个位数。版面是另一回事,工程分不管线缠不缠。
相对完整度、能跑、像参考这三件旧标准,这把尺子更严。十个领域里,现有 agent 还没有稳定的工程级建模能力。
论文写明,评测依赖 MATLAB/Simulink,原生仿真慢,规模做不大。
主实验还有缺口。C 只覆盖 35 题,撑不起跨域判断。结构分类、版面和 30 例专家对照都只看了 Opus 一轮。消融的 10 题是各领域里已经会做的题,不能代表 101 题里的失败。G 门和权重由人按题设定,又绑在参考画像上,没有第二组专家复标。五套系统用 Claude Code,GPT-5.5 用 Codex,比的是模型和脚手架合在一起。