构建波兰法律模型:50B+ 低激活 MoE 是否值得换掉 27B 稠密模型?
SignificantZebra5883 · reddit · 2026-09-29
一位开发者正在构建面向 B2C 的波兰语通用法律模型(起草文书、引用法律来源问答、附带自动化编码能力),工作流高度依赖工具调用,类似 Claude Code 的执行模式。他已用 27B 稠密 Qwen 3 定制微调在法律文书摘要与分类上取得不错效果。
现在他在纠结是否升级到 50B+ 总参数、低激活参数的 MoE(如 70-120B 档),核心疑问包括:
- 推理硬件:希望用租用 GPU 跑并行的 agentic 循环,按需求扩容,关心 TTFT 和吞吐;
- 微调硬件:LoRA 微调预算上限约 vast.ai 上 4 张 GPU;
- agent 表现:工具调用全在本地,快慢取决于模型延迟,需要快速、支持动态推理的模型。
微调目标是波兰语、文书惯例和成功的工具调用轨迹,法律条文本身留在检索/工具层而非靠记忆。他不想只要模型清单,更想要「模型+量化+GPU+推理引擎+上下文长度+并发+实测延迟」的一手配置经验和从 30B 升级到 MoE 后 agent 每分钟成功任务数是否真提升的实证。
「Infra」频道最新
- 开源项目 Celesto:给 AI Agent 一台 500 毫秒启动的专属电脑 — aniketmaurya · 2026-09-29
- 算账:Meta Muse 即便激进优化,每用户年成本也达 50 美元 — bookwormengr · 2026-09-29
- 手机+三台 Mac+两台 PC 拼出 60GB 内存,跑通 gpt-oss-120b — ANR2ME · 2026-09-29
- BioNeMo 团队优化稀疏模型训练:Mixtral 吞吐提升 2.21 倍 — AllThingsApx · 2026-09-29
- DeepSeek 弹性计算团队大量招人,发布大规模 Agent 训练沙盒基建分享 — teortaxesTex · 2026-09-29
- 开发者吐槽第三方推理服务乱象:Gemini 一年涨 10 倍 — julianharris · 2026-09-29