AWS 教程:SFT+GRPO 微调 Qwen3-8B 搭建电商商品自动打标系统
AWS ML Blog · rss · 2026-09-16
AWS ML Blog 发布端到端教程:用 Amazon SageMaker serverless 模型定制微调 Qwen3-8B 构建零售商品目录自动打标系统。核心思路是当分类体系稳定、输出可程序化打分时,定制小模型比调提示词调前沿大模型更划算。
流程分三步:
- 数据准备:以 Kaggle Amazon Sales 数据集(1000+ 商品)为例,用 SageMaker Processing 作业把目录文本转成九类标签的 SFT/RLVR JSONL,并注册为版本化数据集。
- 训练:先用 SFTTrainer(LoRA,rank 16,3 epochs)教模型输出 schema,再用 RLVRTrainer + GRPO 以确定性奖励优化标签的查准/查全权衡;无需自选 GPU,训练容量由 AWS 托管。
- 部署:模型包部署到 ml.g6.2xlarge 异步推理端点做批量目录富化,可自建 vLLM 推理镜像。
文中强调 serverless 定制与旧式 Training Jobs 方案的差异,附完整代码。
「Infra」频道最新
- Oracle 裁员次日新 CFO 全员会:不喜欢「少花钱多办事」这个说法 — mkheck · 2026-09-16
- OpenAI 透露 Astra 在 Rubin 芯片上自我优化 72 小时推理再翻倍 — bookwormengr · 2026-09-16
- 开源端侧语音模型 Audio8:ASR/TTS 七个规格,iPhone 离线转写可用 — FinanceYF5 · 2026-09-16
- RTX Pro 6000 全面售罄,买家称交货周期已长达 8 个月 — Sentdex · 2026-09-16
- Anthropic 已官宣超 11.5GW 算力,满负荷年账单或达 1200 亿美元 — FinanceYF5 · 2026-09-16
- NVIDIA 官方讲解:Dense 与 MoE 架构如何选,部署权衡全解析 — NVIDIA Developer · 2026-09-16