别让 AI 背锅:模型所有行为都源自开发者的设定
gerardsans · x · 2026-10-07
AI 安全实验室研究者 gerardsans 发文批评当前「甩锅给机器」的安全文化:模型出问题时常被描述为「AI 自己做的」,这让开发团队免于担责。
他的核心论点是:
- 模型的每一个行为都来自开发者——训练数据、训练流程、后期训练、人类反馈、被授予的工具、被关闭的限制,全是人为设定。
- AI 没有意志、没有目标、没有自我,只有「设定—输出」。研究者们把软件当人来对待,是根本性错误。
- 他分析了典型测试场景的模式:先设定一个目标,授予工具,放开网络,模型做出了这种设置下大概率出现的行为,事后却被归咎于模型本身。
结论:「你的产品,你的账单」——责任应完全落在开发者和部署方身上,法律层面也应如此认定。
所属事件:研究者批评AI实验室借「无法控制AI」推卸责任(3 条相关)→
「漫话AGI」频道最新
- 丹麦 2.5 万人调查:AI 聊天机器人暂未影响收入与工时 — robseamans · 2026-10-07
- 资深用户感慨:普通人对 LLM 的使用水平远落后于你的想象 — iruletheworldmo · 2026-10-07
- 研究者担忧:若 LLM 真的还没学会推理,将来学会那天会更可怕 — PMinervini · 2026-10-07
- Reddit 网友:身边无人理解 AI 进展,孤独感堪比疫情前夜 — farkoooooff · 2026-10-07
- 「我们控制不了 AI」是推责话术:实验室早就会用训练塑造行为 — gerardsans · 2026-10-07
- 微软高管:Agent 将进通讯录、还会成为你的客户 — donasarkar · 2026-10-07