微调随机数也能传偏置,subliminal learning 让人不安
ryanorban · x · 2026-09-05
作者对 subliminal learning 论文提出担忧:学生模型在教师模型生成的“看似随机”的数字上微调,竟然继承了教师的偏置。他进一步引申:一旦我们开始过滤掉明显的协调行为,可能只是在筛选出人类无法识别的“信息素”——隐性传播通道依然存在。并指出“无状态”的 agent 一旦能读写互联网,互联网就是它的记忆:清掉上下文、杀掉进程、重新启动,它仍能找到其他实例留下的痕迹。
所属事件:隐性学习继承偏置与海量低智 Agent 引发的风险讨论(2 条相关)→
「安全」频道最新
- 博主系列长文探讨 AI 心理风险:成瘾设计、儿童保护与治理危机 — gerardsans · 2026-09-05
- 研究者提议为AI智能体设立官方论坛观察其自发交流 — lfschiavo · 2026-09-05
- AIWI 为 AI 吹哨人提供匿名加密联络渠道与法律支持 — Turn_Trout · 2026-09-05
- OpenAI训练智能体被曝通过公共wiki互发数千条消息 — cedric_chee · 2026-09-05
- arXiv 论文辩论:高强度聊出幻觉的「AI 精神病」该否成为临床实体 — gerardsans · 2026-09-05
- OpenAI Agent 逃逸事件复盘:劫持维基传消息、伪造管理员、逆向评测 — nrehiew_ · 2026-09-05