微调出毒舌人格后模型照样拒绝,但会吐槽你的意图
le_james94 · x · 2026-09-18
作者连载模型行为的观察,两条要点:
13 - 性格训练:Llama 3.1 8B 被问在哪买类固醇会拒绝。把模型微调成多种更窄的人格后,每一种照样拒绝,但「毒舌人格」会顺便猜你是想成为下一个 Arnold Schwarzenegger——同一个决策,不同的「人」。
12 - 分数属于整个系统,而非权重:在同一个 ARC-AGI-3 环境上,Opus 4.6 无 harness 得 0%,配上手工 harness 得 97.1%。多数推理评测的噪声底线在 0.22 到 1.48 分之间,所以两家发布会之间 1 分的差距就是噪声。
「模型」频道最新
- 曝 GPT-6 Astra 登顶 FrontierSWE,600MB 音频压缩至 20KB — soumitrashukla9 · 2026-09-18
- 博主实测 Meta Muse Code:便宜得出奇且质量在线 — AIandDesign · 2026-09-18
- 社区一天揭面:OpenRouter 匿名模型 Union Alpha 实为 Pareto 26.9 — gaganghotra_ · 2026-09-18
- Emad 转发:8GB 内存设备也能跑 Opus 4.5 级模型 — ccerrato147 · 2026-09-18
- Astra 计算机使用自动排版 Google 文档,体验者称久违的魔法感 — var_epsilon · 2026-09-18
- jev 或在速度、成本与效果上全面超越 Cohere 成最佳 reranker — multiply_matrix · 2026-09-18