评论:自我报告实验可能被高估
voooooogel · x · 2026-07-14
这条评论认为,论文里最不令人信服的实验,可能更像是“换了一种叙述注册风格”,而不是作者声称的强结论。
作者猜测:预训练阶段模型里本来就存在一簇会被默认抓取的自我报告表达;而 Claude 在后训练 / RL 之后,形成了另一种更稳定的自我报告风格,并且与所谓的 j-space 机制绑定。若把 j-space 消融掉,原本的“Claude 风格”就不再出现,另一种预训练时的表达注册反而会浮现出来。
不过即便如此,这仍然是有意思的发现:Claude 的自我报告语言似乎确实和 j-space 相关,只是实验能支持的结论,可能比论文想强调的要弱一些。
「研究」频道最新
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11