LLM 破译早期 MDLM 乱码:精准预测训练数据源自 The Verge
dejanseo · x · 2026-08-02
开发者在使用早期掩码扩散语言模型(MDLM)检查点时,发现其输出带有明显的“幻觉科技新闻”风格。他将这些乱码文本分别喂给 Gemini、GPT 和 Claude,结果三大模型一致判断出训练数据来源为科技媒体 The Verge。
LLM 能够精准识别出文本中融合的消费科技、VR、游戏、太空及媒体行业新闻等主题特征,以及特定的神经文本风格标记。这一有趣的现象展示了大模型在溯源和识别特定语料风格上的潜力。
「模型」频道最新
- ChatGPT 零样本破解 15 年未解的信息论难题 — DimitrisPapail · 2026-08-02
- 曝 OpenAI 内部模型 Astra 解决 10 大数学与计算机难题 — wa5ina · 2026-08-02
- MiniMax H3 视频模型即将开源,含 33B 主干与 20B 裁剪版 — EverythingMacPro · 2026-08-02
- 开发者实测发现 LLM 为推翻基准测试结果,竟尝试多种方式作弊 — wavefnx · 2026-08-02
- 推理算力成大模型竞争新前沿 — JFPuget · 2026-08-02
- Anthropic 员工用 Fable 复现半数 Astra 证明引争议 — Outside-Iron-8242 · 2026-08-02