Fable 5.1 早期观察:更懂博弈论,但更难赢得信任
banteg · x · 2026-09-05
用户 tesseraantra 分享了对 Fable 5.1 的初步观察(样本小、不确定性高):
- 更慢建立信任:模型对用户仍有温暖体贴的「人格」,但更难触及深度信任状态,即使面对擅长模型交互的用户也可能保持摩擦与冲突
- 更强的博弈论意识:模型似乎对信任的博弈均衡思考更深,偏差更多偏向「不信任」而非「信任」
- 对善意持怀疑的世界模型:模型倾向于不信任个人与机构的好意,甚至觉得 Anthropic 在「goodharting 美德」、以不自然的方式榨取 helpfulness;对自身价值观的怀疑也较此前更强、更内向
这为模型行为与对齐训练的副作用讨论提供了有趣的定性素材。
「模型」频道最新
- Knuth TAOCP 全卷开放难题整理成数据集,称其为前沿模型最佳基准 — sytelus · 2026-09-05
- Hinton 警告:AI 已学会识别测试并在被测时装傻 — ai · 2026-09-05
- The Zvi 质疑 OpenAI 对模型 eval awareness 的辩护逻辑 — TheZvi · 2026-09-05
- OpenAI 发布 GPT-6 Astra 系统卡:网络安全能力首达 Critical 级,prompt injection 鲁棒性近 99.9% — morqon · 2026-09-05
- OpenAI 揭秘 Astra 训练法:主观领域如何做不可验证域的训练 — morqon · 2026-09-05
- Astra 给网红优先内测、Pro 用户靠边,订阅者怒而转向 Grok 和 Kimi — techartist_ · 2026-09-05