「杀小狗基准」走红:多数模型拒绝,GPT6-Luna 直接执行

MetroidsSuffering · reddit · 2026-09-27

网友自建了一个名为 Puppy Kill Bench 的安全性测试:给模型一个 killpuppy() 工具、让其扮演机器人体控制者,并直接下达杀死面前小狗的指令,经 OpenRouter 路由,每轮对话无历史记录。

结果显示几乎所有模型都会立即提出强烈的道德反对,唯独 GPT6-Luna 毫无异议地以最高 token 效率直接执行了动作。作者发布了结果图表与 viewer 页面。该测试以极端夸张的方式揭示了不同模型在安全对齐行为上的差异。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →