kalomaze:能力迁移弱因行业只做「分域赌运气」,不预测迁移
kalomaze · x · 2026-09-12
kalomaze 在与 StefanGliga 的讨论中 argument:当前 RL 训练能力迁移之所以弱,是因为行业并未真正尝试通过更好的「迁移预测」来显式瞄准它;现有做法压倒性地是「按显式领域分层然后祈祷」。人类对什么能带来广泛迁移的直觉很差,于是只堆人们已经知道要的合成数据——通常是 SWE 工程师关心的那些。
所属事件:kalomaze:信息不对称而非可验证性决定 RLVR 泛化(9 条相关)→
「研究」频道最新
- 果蝇全脑连接组学会玩 Flappy 类小游戏 — TinfoilTricorn · 2026-09-12
- PQShield 提出无浮点 Falcon 实现,定点运算规避侧信道风险 — jedisct1 · 2026-09-12
- jd_pressman 论模型对齐:现在的「善意种子」值得追踪放大 — jd_pressman · 2026-09-12
- Intel 工程师实测共封装光学:V 型槽边缘耦合新方案 — jwt0625 · 2026-09-12
- NVIDIA 系统研究流式多说话人 ASR,梳理四种架构权衡入选 Interspeech 2026 — alexcovo_eth · 2026-09-12
- 望月新一 abc 猜想失败对照:AI 证明只要可验证就有效 — RexDouglass · 2026-09-12