开发者开源 7 亿参数模型 Shibai-700M,基于 180 亿 token 预训练

TheOneWhoWil · reddit · 2026-07-30

开发者 TheOneWhoWill 在 Hugging Face 上开源了 Shibai-700M-Base 模型。该模型拥有 7 亿参数,使用 180 亿 token 进行了预训练,数据主要针对 Python 和 Wikitext 进行了优化。

作者表示,虽然性能不及 Qwen 3 0.6B 等同级模型,但远优于 GPT-2。目前该模型仅支持基础的下一个 token 预测,未进行对话微调。作者计划未来继续使用约 50 亿基于 Python 文档字符串的 token 进行持续预训练。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →