独立开发者求发起 9.4B 稠密模型训练,单卡可跑全程开源
NineThreeTilNow · reddit · 2026-09-13
LocalLlama 用户发起征集:他已完成一个约 9.4B 参数稠密模型的全部设计与稳定性测试,准备免费开源训练并征求社区对用途的意见。
- 技术细节:包含 1/2/3 层 Engram 表注入、Moonshot 风格 AttnRes 建模、RoPE/NoPE 3:1 分层;使用 Llama 3 tokenizer 与 LM Head 起步,训练数据为从 Llama 3 教学模型提取的 logit 级数据。
- 他在单张 4090 + 租用硬件上完成了全部数据生产,训练代码针对单张 RTX 6000 Pro 深度优化;目标是训练出强于现有 9B 级模型的版本,并加入 open standard 的 thinking 能力。
- Qwen 新模型发布让他确认 Engram 单表注入即可拿到大部分收益,于是把设计从 2 表减到 1 表。
- 代码、数据全部公开在公共仓库;过程中还发现并上报了 vLLM prompt 加载代码可提速 10-100 倍的问题。
「模型」频道最新
- DeepSeek V4.1 服务成本更低但定价翻倍,毛利率或显著走高 — teortaxesTex · 2026-09-13
- Motorhomelabs 预告新品,呼应开源模型一年内或遭严管预测 — aiamblichus · 2026-09-13
- 评论员谈 DeepSeek:没有单一主线,战略目标是无限上下文 — teortaxesTex · 2026-09-13
- GPT 只会说好话?用户实例展示 AI 谄媚与「AI 精神病」风险 — GlenBradley · 2026-09-13
- 自建编排器报错"astra 无权访问 Daybreak",神秘模型现身 — LeopardBernstein · 2026-09-13
- kalomaze 直言 Opus 5 是个很糟糕的模型 — kalomaze · 2026-09-13