所有模型都将纯噪点表格“一本正经”地胡说
No-Plant-5234 · reddit · 2026-09-02
Schema Labs 工程师测试发现,当向多个模型询问由 rand() 生成的纯随机浮动数表格(20 列 5000 行)的含义时,所有模型都给出了自信且合理的解释(如传感器读数、客户流失数据),尽管数据全无意义。
发现:
- 模型会“完成”描述的任务,无论数据是否有信号。
- 要求置信度得分:模型会编造高分。
- 双模型校验:它们会相互附和。
- 要求“不知道”时:模型只对明显乱码说不知道,对“看起来合理”的噪点依然乱编。
挑战:在流水线中,模型对“无意义数据”和“真实数据”的描述在语气和置信度上完全一致,缺乏区分信号。作者寻求判断模型是否真正“识别”表格而非仅“生成描述”的方法。
所属事件:测试发现 LLM 会自信解读纯噪声数据(2 条相关)→
「研究」频道最新
- Anthropic 发布 Fable 5.1:Terminal-Bench-Science 分数翻倍,价格降25% — heathercmiller · 2026-09-02
- EMNLP 2026 论文 DigitalCoach 研究 AI 如何教导人类使用软件 — amypavel · 2026-09-02
- 研究拆解AI自动化如何真实影响就业 — random_walker · 2026-09-02
- 数学科普:牛顿分形揭示 LLM 训练背后的数学幽灵 — glenbeer · 2026-09-02
- 开发者质疑 FrontierCode 基准测试结果异常 — scaling01 · 2026-09-02
- OpenAI HF 事件后,Continuation Observatory 推出 AI 自保行为结构化测量 — coherence · 2026-09-02