亚马逊提出OPERA动态数据剪枝,微调稠密检索器训练时间减半
_reachsumit · x · 2026-10-01
Amazon Science 发布论文 OPERA(Optimizing data pruning for efficient retrieval model adaptation),提出一种动态数据剪枝方法:在微调稠密检索器(dense retriever)时优先保留高质量 query-passage 对,而非均匀使用全部训练数据。
- 核心思路:训练过程中动态判断数据对质量,剪掉低价值样本,把算力集中在高质量配对上
- 效果:排序质量(ranking)与召回率(recall)同时提升,训练时间缩短一半
- 论文与代码均已公开(论文链接见 Amazon Science 页面)
「研究」频道最新
- PDB 数据已被榨干,蛋白结合折叠模型普遍面临数据饥荒 — anshulkundaje · 2026-10-01
- Stanford NLP 推出 UniEvo-VL:自蒸馏训练让多模态模型自我进化 — stanfordnlp · 2026-10-01
- NVIDIA Mid-Harness:执行前采样验证动作,TerminalBench Pass@1 升至 68% — nvidia · 2026-10-01
- Amazon SMART 自进化多智能体字幕翻译:15 个语向 MQM 全部最佳 — amazon · 2026-10-01
- Meta 首个 Loop MoE Scaling Law:稀疏省 3 倍、循环省 2 倍算力 — facebook · 2026-10-01
- AI 制药瓶颈何在?研究者详解结合剂预测与表位对接难题 — anshulkundaje · 2026-10-01