作者称新 LLM 架构在更低参数与算力下同时改善多项指标

AlternativeSure2891 · reddit · 2026-09-06

一位 Reddit 用户称在研究一种不同的 LLM 架构,早期结果显示验证损失更低,同时参数更少、FLOPs 更少、显存更省、KV cache 更小,训练与推理也明显更快——多项通常互为代价的指标同时向好。已用 1B+ 的 Python 数据集训练,暂不公开架构细节,也拒绝现在称为突破,称需观察更长训练、更多数据与更大规模下优势是否成立,官方 benchmark 正在安排。属于未证实的独立声称。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →