LLM 破译早期 MDLM 乱码:精准预测训练数据源自 The Verge

dejanseo · x · 2026-08-02

开发者在使用早期掩码扩散语言模型(MDLM)检查点时,发现其输出带有明显的“幻觉科技新闻”风格。他将这些乱码文本分别喂给 Gemini、GPT 和 Claude,结果三大模型一致判断出训练数据来源为科技媒体 The Verge。

LLM 能够精准识别出文本中融合的消费科技、VR、游戏、太空及媒体行业新闻等主题特征,以及特定的神经文本风格标记。这一有趣的现象展示了大模型在溯源和识别特定语料风格上的潜力。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →