Periodic Neon 用实验室数据后训练,胜 GPT-6 Astra 与 Claude Fable 5.1
zainhas · x · 2026-09-16
Periodic Labs 发布自研模型 Periodic Neon:用自家实验室数据训练,在一项高难度科学分析评测上以更低成本超越 GPT-6 Astra 和 Claude Fable 5.1,并已部署到实验室分析真实实验。
关键事实:
- 任务是 X 射线衍射(XRD)分析:科学家通常要花数小时穿行科学软件、文献与数据库来解析复杂 XRD 数据,是新材料发现的关键能力,Neon 正用于寻找更好的超导体和磁性材料。
- 成绩:在最难的内部评测集 FrontierXRD(134 个实验室样本)上达到 55.3% 成功率,是对其后训练的底座 Kimi K2.6 初始 2.7% 的 20 倍提升,通过 midtraining 和强化学习实现,建立 Pareto 最优的成本-性能前沿。
- 方法:自有实验室数据 midtraining + RL 后训练;自研 Periodic Harness 在其场景下优于 Claude Code、Codex 等现成编码 harness。
- 评测方法:LLM 裁判集成(Opus 5 与 GPT-5.6-Sol)并按专家评分校准;成本按 H200 $2.5/小时与系统吞吐估算,外部模型按标准 API 价格假设完美缓存估算。
展示了「领域专属后训练 + 自研 harness」在垂直科学任务上击败前沿通用模型的可行路径。
所属事件:Periodic Labs 用 1300 张 H200 训出材料科学模型 Neon 引热议(57 条相关)→
「模型」频道最新
- OpenRouter 上 OpenAI 消费额 2.5 年来首超 Anthropic — soumitrashukla9 · 2026-09-16
- 安全研究者:OpenAI 智能体协作是训练使然,非涌现行为 — vishalmisra · 2026-09-16
- 新模型走出隐身:不能聊天,号称比 LLM 快且便宜百倍 — hardimanjames · 2026-09-16
- 对比 OpenAI 条款话术,分析师认为 Meta 更可能真正排除用户数据训练 — ivan_bezdomny · 2026-09-16
- DeepSeek V4.1 Flash 跑长 Agent 任务屡屡超时,作者公开详细故障数据 — sebnadeau · 2026-09-16
- GPT-6 Astra 单提示词自主干8小时,用Blender低多边形复刻权游 — OWazabi · 2026-09-16