GPU 多到没处用:有人用 PTX 当词表预训练了一个基础模型
rickasaurus · x · 2026-09-28
BenKoska 介绍一项离谱但硬核的实验:在 GPU 过剩的情况下,用约束解码在预训练阶段把 PTX(NVIDIA GPU 汇编语言)当作语言——模型的 tokenizer 是 PTX,思维是 PTX,输出全是 PTX,完全不使用自然语言。这一实验展示了如何用受限解码把基础模型预训练绑定为特定形式语言,属于对预训练范式的趣味探索。
「Infra」频道最新
- Fireworks 推理平台后训练 Kimi K3,同质量省 40% 成本 — isidentical · 2026-09-28
- 一个驱动开关让 AMD 双卡 Vulkan 推理提速最高 4 倍 — tabletuser_blogspot · 2026-09-28
- PrismML 三值压缩 Qwen3.8 27B 至 5.9GB,能力保留 98.2% — dl_weekly · 2026-09-28
- 开发者拟让 Codex 决定跑哪些测试,大幅削减 CI 成本 — sull · 2026-09-28
- 免费在线 LLM 原理全指南:从 token 到本地部署全链路 — JFPuget · 2026-09-28
- 向量数据库够用吗?Reddit 热议 Agent 生产级存储难题 — OkShirt9372 · 2026-09-28