Thinky 模型的缩放与多模态判断
burny_tech · x · 2026-07-16
转发内容总结了对 Thinky 模型的几项技术判断:
- muP 重新变得有意义:作者认为在 1T+ 级模型上,muP 有助于保证 scaling ladder 的收益。
- 稀疏性偏低:推测可能受硬件约束或较低 MFU 影响。
- 45T tokens:这是目前已公开的开放模型里最高的训练 token 数之一;作者认为这个量级与其 scaling law 预期一致,但模型质量看起来仍偏弱,说明有效参数带来的增益不够强。
- 一些架构选择较奇特:包括 attention 中的卷积、weight decay 与学习率的耦合,作者认为这大概率与具体训练设置强相关。
- 原生多模态训练:作者推测团队可能已从 OpenAI 学到相关方法,接下来会把它作为开放模型的差异化重点,并猜测多任务训练可能有助于代码和推理能力。
所属事件:Inkling 表现与相关架构猜测升温(7 条相关)→
「模型」频道最新
- 传 OpenAI 在 Astra 中使用 neuralese 循环变换器,新的 scaling 轴浮出水面 — imadade · 2026-09-03
- XBOW 团队拿下今年首个 Chrome 全链漏洞利用奖励 — moyix · 2026-09-03
- Gemini 3.8 Flash 的 Pareto 最优地位仅维持了 5 小时 18 分钟 — alejandroll10 · 2026-09-03
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Anthropic 商务智能体只建购物车交人工结账,被赞退款风控思路对 — HaktanSuren · 2026-09-03
- Qwen3.8 27B Q8 翻车:12 万 token 后发现根本没读计划,自行实现别的功能 — KingCpzombie · 2026-09-03