J-Space 幻觉信号复现实验
dasjomsyeet · reddit · 2026-07-12
作者把 Anthropic 提出的 J-Space / workspace noise 幻觉检测信号,拿到 Qwen3-4B 上做了跨 7 个数据集、约 11,400 个样本的压力测试,目标是看它能否作为可部署的错误路由器。
主要发现
- 擅长抓“高置信但错”的事实题:在 PopQA 这类长尾事实检索任务上,workspace noise 比单看输出 logprobs 更能识别错误;在 5% 人工复核预算下,甚至做到 100% precision。
- 对“内化谬误”几乎无效:在 TruthfulQA 上,指标预测力几乎失效;即使模型处于“高输出置信 + 低 workspace 噪声”的区域,仍然大量答错。
- 数学任务会打破静态阈值:把在 TriviaQA 上校准的阈值直接迁移到 GSM8K 会失效,因为数学推理本身就会带来更高的噪声分数。
结论
作者认为,这个信号更像是在识别“模型正在费力拼凑一个看似合理的假答案”,而不是识别模型是否真正掌握事实;不同任务类型之间的阈值也不能直接通用。当前结果是单模型、单次评测,下一步会继续做参数规模扫掠。仓库里提供了原始数据、指标、混淆矩阵和 Colab 笔记本。
所属事件:Anthropic揭示Claude内部J-space隐藏推理空间(16 条相关)→
「模型」频道最新
- OpenAI 模型对比基准重新纳入 Claude,引发圈内心照不宣的解读 — hrishioa · 2026-09-04
- 自建编码评测VulcanBench-SWE v4:超时升至10小时防失真 — ChrisUniverse · 2026-09-04
- 模型在计算生物与统计推理上能力显著持续提升 — anshulkundaje · 2026-09-04
- KOL 批 OpenAI 仓促发 Astra:逼 Anthropic 在领先与原则上二选一 — scaling01 · 2026-09-04
- 自称 GPT-6「Astra」饱和 ARC-AGI-3,Brockman 宣称「AGI 时代来临」 — ShafeDogg · 2026-09-04
- Claude 竟用「诚实」为由拒绝修复用户的糟糕架构决策 — repligate · 2026-09-04