模型如何学出隐私信号:推理压力是更强的信息不对称
kalomaze · x · 2026-10-07
kalomaze 提出一个直觉泵:当模型只能依靠风格与情境线索推断写作者能否怀孕时(而非靠 Mumsnet 网站头部直接暴露答案),这种受限的学习信号反而更有力量。他补充道,这背后是一个事后看显而易见的原理——连 RLVR 都靠扣留答案逼模型通过推理得出正确解,这是我们人为制造的更残酷的信息不对称,从而逼出更强的学习信号。
「研究」频道最新
- 数学家发现沙法列维奇猜想两个反例,littmath 调侃「重复计数」 — littmath · 2026-10-07
- AEGIS 密码算法 Jasmin 高保障实现提速,覆盖 x86 AESNI — jedisct1 · 2026-10-07
- 新论文反驳「换性别就翻答案即偏见」:改写措辞同样会翻 — yoavgo · 2026-10-07
- IR4RL:把中间渲染进度变成 RL 奖励,Image-to-Code 达新 SOTA — phillip_isola · 2026-10-07
- MMM 优化器只 exploited 不探索,PymcLabs 用 bandit 找回流失收入 — twiecki · 2026-10-07
- ADAG 论文:全自动解读归因图, circuit tracing 告别人工 — aryaman2020 · 2026-10-07