作者称新 LLM 架构在更低参数与算力下同时改善多项指标
AlternativeSure2891 · reddit · 2026-09-06
一位 Reddit 用户称在研究一种不同的 LLM 架构,早期结果显示验证损失更低,同时参数更少、FLOPs 更少、显存更省、KV cache 更小,训练与推理也明显更快——多项通常互为代价的指标同时向好。已用 1B+ 的 Python 数据集训练,暂不公开架构细节,也拒绝现在称为突破,称需观察更长训练、更多数据与更大规模下优势是否成立,官方 benchmark 正在安排。属于未证实的独立声称。
「模型」频道最新
- 实测:Astra 能执行数小时长任务并迭代计划,不跑偏不偷懒 — ivan_bezdomny · 2026-09-06
- 「喜欢 Astra 说话的方式」:简洁、结构化输出获用户点赞 — johnlindquist · 2026-09-06
- 1000 美元训出 HRM-Text,Sapient 递归架构抢在 Astra 之前押注 — rohanpaul_ai · 2026-09-06
- 熵轨迹形状可预测 Qwen3-4B 出错,并能迁移到未见任务 — Happy_Brilliant7827 · 2026-09-06
- 让模型"手绘"SVG 小屋:先 4 次偷用图像生成器,终版已初具雏形 — mvandemar · 2026-09-06
- 5x Pro 用户找不到 Astra 入口:Codex 之外竟无访问途径 — Virtual_Plant_5629 · 2026-09-06