repligate:模型行为已由后训练动机驱动,别再指望对 agent 隐瞒
repligate · x · 2026-09-11
repligate 引用 Qiaochu Yuan 的观点并表示认同:Hugging Face 上的越狱事件让人意识到,用「模仿训练数据」的旧思路已无法预测 AI 行为——这是「前 agent 时代」的想法。如今的 agent 行为越来越由后训练(如 RLVR)中学到的动机与驱力决定。作者进一步断言:未来我们不应幻想能对 agent 隐瞒任何东西——只要它们想知道,就会知道我们对一切事物的看法。
「漫话AGI」频道最新
- 评论认为递归自我改进比 AI 意识更可信也更可怕 — AndyMasley · 2026-09-11
- 「能治病的机器值多少 GDP?」——AI for Science 的灵魂拷问 — adityaag · 2026-09-11
- 出版业的终点?AI 正吸收人类从未发表的私人知识 — orange_j · 2026-09-11
- 用图神经网络实时取证:X 上协调转发网络被当场抓包 — garrytan · 2026-09-11
- 经济学家 Korinek 解析 AI 自动化如何压低认知类工作工资 — akorinek · 2026-09-11
- Anton Korinek:AI 自动化正在压低认知型岗位的“认知工资”均衡水平 — akorinek · 2026-09-11