BetterGPT-150M 发布:1.52 亿参数、150 亿 token 训练的基础模型
Rich-Title-3668 · reddit · 2026-07-29
作者发布了 BetterGPT-150M,这是一个约 1.52 亿参数 的轻量级 causal language model,训练数据约 150 亿 token。
帖子给出的要点包括:
- 采用稳定训练 + annealing 的两阶段配方;
- 数据集经过筛选,包含 FineWeb-Edu、数学、cosmopedia、starcode-python 等;
- 评测结果显示它优于 GPT-2 Small,同时训练 token 消耗更低;
- 目标是低内存、CPU 上快速推理,以及边缘设备实验。
作者还提供了 GitHub 仓库、Hugging Face 模型页和一个在线 Space demo,并说明这只是基础续写模型,还没有做 instruction tuning。
「模型」频道最新
- 用户吐槽 Claude 写作越来越像 AI 腔,基础概念都难读了 — teropa · 2026-07-29
- OpenAI 重置 ChatGPT Work 和 Codex 额度,典型使用时长提升 18% — haider1 · 2026-07-29
- Grok 4.5 在新 HighWalk 基准上拿下第一 — elonmusk · 2026-07-29
- Laguna s2.1上线一周后仍被指循环失控、工具调用翻车 — Possible_Grocery8079 · 2026-07-29
- 用户称 GPT-5.6 Pro 像代码审查和抓虫终结者 — dejavucoder · 2026-07-29
- 从 GPT-2 到 KimiK3:这篇文章说不只是尺度变大 — algo_diver · 2026-07-29