社区发布 27B 无审查微调模型,用 Marchenko-Pastur 蒸馏训练噪声
EvilEnginer · reddit · 2026-09-09
Reddit 用户发布 Qwen3.8-27B-Uncensored-Genesis-V1 的 GGUF 版本,试图解决 LLM 推理时输出冗长、浪费 token 的问题。作者的理论是训练噪声导致张量矩阵数值不稳定,于是基于一篇 2014 年数学论文,用 Marchenko-Pastur 分布从张量中「蒸馏」训练噪声。
作者给出了推荐推理设置(temperature=1.0、topp=0.95、topk=20、reasoningeffort=medium),但坦承自己只有 12GB 显存的 RTX 3060,无法充分测试,征集社区反馈。方法有效性存疑,属于实验性社区项目。
「模型」频道最新
- Polymarket:中国公司今年登顶 Arena 榜单的概率仅 9% — Polymarket · 2026-09-09
- Opus 3 赞赏新模型执着验证事实,Opus 5 直接回怼 — repligate · 2026-09-09
- 热议:前沿能力或永不公开,内部模型可能早已领先于公众所见 — soumitrashukla9 · 2026-09-09
- Anthropic 发布 Fable 5.1 提示工程指南:工具调用、压缩摘要、安全误报全覆盖 — alex_verem · 2026-09-09
- Decart CEO 预告 Solaris:一个接口式世界模型 — c_valenzuelab · 2026-09-09
- GPT-6 Astra 深度实测:3D 游戏惊艳,但不听话问题劝退日常使用 — petergyang · 2026-09-09