Unbounded Labs 发布 1931 年前语料训练的复古 LLM Bart
soggydoggy8 · reddit · 2026-08-25
Unbounded Labs 宣布开源 Bart,一个 2.82B 参数的“复古”LLM,完全基于 1931 年前的英语文本(201B tokens)训练,成本约 800 美元。
项目亮点:
- 在 Vintage CORE 基准上超越 GPT-1900。
- 清理了哈佛学院图书馆书籍数据集(242B -> 23B tokens)。
- 创建了首个复古 LLM 基准套件 Vintage CORE(20 个基准)。
- 在单张 H100 上运行了 10 小时自主研究,执行 100 次实验并发现 26 项改进。
- 发布了最大的复古 SFT 数据集(41.6 万个问答对)。
- 5 天内在 H100 上完成训练,保持 60% MFU。
所有数据集、方法、代码、评估和训练记录均已开源。团队正在寻求算力资助、资金和导师支持,以推进更大的训练运行。
所属事件:Unbounded Labs 开源复古 LLM Bart,仅用 1931 年前语料(2 条相关)→
「模型」频道最新
- 测试显示 Qwen 3.8 27B 在低比特量化下表现优于高比特 — rohanpaul_ai · 2026-08-25
- Atomic Chat 发布 Qwen 3.8 27B GGUF 量化模型集合 — rohanpaul_ai · 2026-08-25
- MiniMax 官宣:GMI Cloud 上 M3/M2.7 等 14 天无限量免费 — MiniMax_AI · 2026-08-25
- 用户称 Ox Alpha 持续变强,推测具备每日自我修改能力 — kimmonismus · 2026-08-25
- Anthropic 抱怨蒸馏遭反驳:Kimi、GLM 已免费提供前沿能力 — Leafytreedev · 2026-08-25
- GPT-5.6 Sol 模型降价:输入输出分别降至 4/10 美元 — MatthewBerman · 2026-08-25