研究挑战共识:用户回复里的「这不对/有用」反馈可训练利用
LChoshen · x · 2026-09-03
一项新工作挑战了「用户回复中的反馈信号太噪、难以利用」的普遍看法。模型训练中直接利用用户自然给出的反馈(如「这是错的」「成功了!」)通常被认为噪声大、难以有效使用,但研究者证明这类信号其实可以被有效利用。合作者包括 LChoshen 与 AbendOmri,论文链接见原文。
「研究」频道最新
- Cohere 发布 ATE 数据集:从 MCP 服务器抓取近 70 万工具看 Agent 生态 — Cohere_Labs · 2026-09-03
- Recursive LM 原作者释疑:实验结论与论文本意并不相同 — CShorten30 · 2026-09-03
- Qwen-RobotManip:对齐先行,解锁机器人操作模型规模化 — rsasaki0109 · 2026-09-03
- 高分辨率文档检索嵌入压到 6KB:255 倍压缩保留 95% 精度 — lateinteraction · 2026-09-03
- NeoMME-Retriever 260M 拿下 ViDoRe v3 小模型组最高分 — lateinteraction · 2026-09-03
- NeoMME:单塔多模态多语言编码器,260M 版检索成绩超同级模型 — CShorten30 · 2026-09-03