实验显示 Qwen 内部藏有微小的 GPT2 自我模型
paraschopra · x · 2026-09-22
Paras Chopra 基于 LessWrong 上的假说——互联网充满 LLM 生成文本,现代 LLM 可能内含对 LLM 本身的「自我模型」——做了一项探索性实验。
实验设计
- 选用 GPT2-medium 与 Qwen3 base(4B);起点是 2026 年 9 月 18 日的 12 条新闻标题,确保超出两者训练截止、排除记忆。
- 让 GPT2 先续写 96/256/512 token,再分别由 GPT2 自己和 Qwen 续写 32/64/128 token;同时记录 Qwen 的自然续写。
核心发现
- Qwen 补全 GPT2 开头的文本时,其风格更接近 GPT2 的续写,而不是自己的自然续写,说明 Qwen 能在内部模拟 GPT2 的风格。
- 作者据此认为大模型在预训练中学到了对 LLM 生成文本分布的隐式自我建模;下一步计划用 LLM 判断续写来自哪个模型来定量验证。
作者强调这是 quick-and-dirty 的探索性研究,结论有待更严谨实验。
「模型」频道最新
- GGUF 模型可直接在 Hugging Face transformers 中运行,Mac 推理提速 — pcuenq · 2026-09-22
- 对抗 Grok Bot 与 Meta Muse:个人 AI 助手的实战用例盘点 — Efistoffeles · 2026-09-22
- 15 个月提速 20 倍:Claude 50 小时通关宝可梦超过人类小孩 — ben_j_todd · 2026-09-22
- 开发者实测 Jev:多数用例是过度设计,浏览器操作最快 — EXM7777 · 2026-09-22
- Polymarket 押注 Meta Muse Spark 1.4+ 一个月内发布概率达 73% — Polymarket · 2026-09-22
- 智谱 GLM MoE 模型 W4A16 量化版登上 Hugging Face 热榜 — AikidoSec · 2026-09-22