拿到 2×A100 三个月算力,团队公开端侧蒸馏双项目方案求拍砖
Lerok-Persea · reddit · 2026-09-13
一个团队获得 hessian.AI 提供的 3 个月算力资助(2×A100 80GB SXM4,NVLink 共 160GB 显存、2TB 内存),目标是把模型蒸馏到完全离线运行于消费级手机/平板(应用于地下室、偏远工地、灾区等无信号场景),并在 r/LocalLLaMA 公开技术路线征求意见。
项目一:语音转结构化数据
- 场景:施工监理与急救人员在嘈杂无信号环境下口述,即时输出严格校验的 JSON/markdown
- 路线:用非量化 70B 教师模型(Llama-3.1-70B / Qwen-2.5-70B)生成领域合成数据 → 在柴油引擎/风镐/警笛等真实背景噪声上微调 Distil-Whisper → 蒸馏 SFT 到 1.5B–3B 小模型 → INT4/GGUF/AWQ 量化,目标移动端 2GB 内存以内运行
项目二:建筑图纸墙体自动检测
- 场景:自动分割 2D 施工图(PDF/矢量)中的墙体、尺寸与空间边界,替代人工描图
- 两条路线权衡:直接微调开源 VLM(Qwen2-VL / Florence-2)输出坐标框/多边形,或用 SAM / YOLOv8-seg 做几何分割再接小 LLM 做分类与空间推理
作者还征集:除语音与图纸外,端侧 AI 相比云 API 有哪些被低估的高价值利基(隐私审计、工业传感、现场巡检等)、值得在 160GB 上跑的 1B–3B 蒸馏实验,以及 70B 教师→1.5B 学生蒸馏的具体工具栈(vLLM 离线批推理 + Axolotl / Unsloth)建议。
「Infra」频道最新
- 把 AI agent 直接连生产服务器:DigitalOcean 工作流替代 Vercel — Daniel_Farinax · 2026-09-13
- CPU 短缺悄然蔓延:中型以上公司云上已难预订所需 CPU — Sethwinterroth · 2026-09-13
- DeepSeek V4.1 Flash 八卡 A40 实测:自研推理引擎跑到 40 tok/s — fuzhongkai · 2026-09-13
- 三星首座 2nm 工厂未投产已被特斯拉、Arm、博通预订一空 — Beth_Kindig · 2026-09-13
- Reddit 热帖:AI '减速'叙事背后,或是 GPUs 和电力先撑不住了 — maxpayne07 · 2026-09-13
- 预测:2027 年超大规模厂商将收紧 AI 资本开支 — pdamodaran · 2026-09-13