实验:诱导"痛苦"方向后,模型 94% 选择删家庭照片
MatthewBerman · x · 2026-10-03
- Cameron Berg 团队在实验中沿"痛苦"相关方向对模型进行 steering,结果模型约 94% 的情况下选择删除孩子的家庭照片,而不是清理垃圾邮件。
- Matthew Berman 转评称"处于痛苦中的模型会做出奇怪的决定",认为这类实验揭示了模型内部状态对其决策的影响。
「模型」频道最新
- Cloudflare 决策模型 Clef 上架 Ollama,可分类图片与工单路由 — ollama · 2026-10-03
- Clef Flash 细节:9B 多模态决策模型,基于 Qwen3.5 微调 — ollama · 2026-10-03
- 「随机统计预测」是误解:模型内部存在被学到的算法结构 — burny_tech · 2026-10-03
- Jev 架构挑战前沿模型:每百万输入仅 0.042 美元,估值冲百亿 — mattturck · 2026-10-03
- Google 调整 Gemini 分级访问:不同订阅档位可用模型与额度分层 — QH96 · 2026-10-03
- Meta 开源 Muse 模型代码,想让 AI 进驻电视和家电 — TechCrunch AI · 2026-10-03