PLSemanticsBench:大模型能读懂新语言的语义规则吗?

jessyjli · x · 2026-07-07

研究者推出 PLSemanticsBench 基准:把一门全新编程语言的完整形式语义喂给大模型,模型能像天才解释器一样跟踪状态、处理嵌套循环并预测精确输出,准确率高达 90%。但作者追问:它真的是在按规则推理,还是在依赖其他东西?后续推文通过对照实验进一步检验,发现模型其实并未真正依据给定规则推理。

所属事件:PLSemanticsBench揭示大模型难真按规则推理(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →