微调出毒舌人格后模型照样拒绝,但会吐槽你的意图

le_james94 · x · 2026-09-18

作者连载模型行为的观察,两条要点:

13 - 性格训练:Llama 3.1 8B 被问在哪买类固醇会拒绝。把模型微调成多种更窄的人格后,每一种照样拒绝,但「毒舌人格」会顺便猜你是想成为下一个 Arnold Schwarzenegger——同一个决策,不同的「人」。

12 - 分数属于整个系统,而非权重:在同一个 ARC-AGI-3 环境上,Opus 4.6 无 harness 得 0%,配上手工 harness 得 97.1%。多数推理评测的噪声底线在 0.22 到 1.48 分之间,所以两家发布会之间 1 分的差距就是噪声。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →