给模型喂纯噪声表格,它照样编出「传感器数据」分析

No-Plant-5234 · reddit · 2026-09-02

Reddit 用户做了一个实验:构造一张完全随机噪声的表格(随机浮点数、列名 c1–c20、无任何真实结构),让多个 LLM 描述该数据集。结果所有模型都给出了言之凿凿的描述——有的称其为「制造业设备传感器读数」并分析列间相关性,全程无错误提示、无犹豫措辞。

作者指出这是语言模型「补全」本性使然,但对 agent 工作流是个隐患:如果 agent 遇到陌生表格的第一步是问模型这是什么表,得到的永远是自信回答,输出中没有任何信号能区分「真懂」和「编的」。实测追问置信度数字,模型会编造一个;用第二个模型校验第一个,两个模型还会互相印证。作者在 SchemaLabs 工作,他们的专用表格模型在噪声文件上会返回「未识别领域」,但他自认测试设计粗糙(「喂垃圾看它认不认」),向社区求教更严格的测试方法,以及大家的 agent 是否存在「承认数据源不可读」的退出路径。

所属事件:测试发现 LLM 会自信解读纯噪声数据(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →