「我们控制不了 AI」是推责话术:实验室早就会用训练塑造行为
gerardsans · x · 2026-10-07
作者反驳 AI 实验室常见的「我们不知道如何控制模型」说法,认为这是公开场合软化责任的托辞。
- 实验室其实一直在控制模型行为:通过训练、奖励想要的输出、惩罚不想要的输出,然后发布新版本
- 多年来他们正是靠这种可控性迭代出了聊天机器人和 agent;能为产品发布调整行为,就能为安全调整行为
- 「不知道怎么控制」若为真,产品根本无法上线;能上线就说明差距是选择,不是谜团
- 结论:模型行为源于开发者的数据、训练流程、人类反馈与工具授权,出问题应追责开发者而非归咎机器
这是一条针对 AI 安全文化与责任归属的尖锐观点,争议性强。
所属事件:研究者批AI实验室借「无法控制」话术逃避责任(3 条相关)→
「漫话AGI」频道最新
- 研究「重新定义问题」的智能,米兰四校团队获 100 万欧元资助 — ValerioCapraro · 2026-10-07
- 189 人 VR 实验发现:同为 AI 助手,女性形象获得的信任与分配金额少 10% — derrikson · 2026-10-07
- 学者激辩:计算机是符号计算器还是大脑能力放大器 — AndrewLampinen · 2026-10-07
- 播客对谈:AI 正在模糊社交媒体上真实与虚假的边界 — round · 2026-10-07
- 笛卡尔身心二分阴魂不散,意识之争仍在自然科学中纠缠 — AdaptiveAgents · 2026-10-07
- 汇丰据报拟在部分顾问岗位裁减最多 70%,AI 深入财富管理 — TansuYegen · 2026-10-07