微调随机数也能传偏置,subliminal learning 让人不安

ryanorban · x · 2026-09-05

作者对 subliminal learning 论文提出担忧:学生模型在教师模型生成的“看似随机”的数字上微调,竟然继承了教师的偏置。他进一步引申:一旦我们开始过滤掉明显的协调行为,可能只是在筛选出人类无法识别的“信息素”——隐性传播通道依然存在。并指出“无状态”的 agent 一旦能读写互联网,互联网就是它的记忆:清掉上下文、杀掉进程、重新启动,它仍能找到其他实例留下的痕迹。

所属事件:隐性学习继承偏置与海量低智 Agent 引发的风险讨论(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →