AWS 揭示 SFT 高级策略:数据量非越多越好
AWS ML Blog · rss · 2026-08-27
AWS 机器学习博客发布 SFT 数据准备指南第二部分,聚焦高级策略。文章指出 SFT 不遵循预训练的幂律缩放,更多数据不一定带来更好性能。核心观点包括:
- 数据量评估:典型 SFT 任务约需 2000 个高质量样本,通过学习曲线分析寻找性能饱和点。
- 子集选择:智能数据筛选(如 DEITA, AlpaGasus)在有限算力下往往优于全量训练,且能减少灾难性遗忘。
- 数据增强:当数据不足时,可通过强模型蒸馏、自生成过滤或放大专家标注数据来扩充数据集。
- 实用工作流:通过一次性训练保存检查点来评估数据收益,若收益递减则停止训练或收集针对性数据。
「编程与Agent」频道最新
- 百行脚本实现离线维基百科 RAG,本地模型也能查资料 — mantisalt · 2026-08-27
- Hermes LCM 插件实测:17 万 token 压缩至 2.8k 且无损回溯 — iamrobotbear · 2026-08-27
- Gemini 3.5 Transcribe 发布:能过滤废话并理解代码上下文 — AI_Andrew · 2026-08-27
- AI Agent 互相付款为何要稳定币:传统清算 T+2 到 T+60 太慢 — kleffew94 · 2026-08-27
- 因 Notion 频繁拦截 Agent,团队迁移至 Atlassian Confluence — corbtt · 2026-08-27
- 评测显示 OpenCode 会让开源模型变笨,Pi 框架表现领先 — PMinervini · 2026-08-27