作者训练「故意错 98%」模型 Bev:专测你的置信度阈值管不管用
ricyoung · reddit · 2026-10-07
ricyoung 训练了一个专门犯错的决策模型 Bev:基于 Qwen3.5-9B 微调,收到情境和问题时故意选最差答案并给出概率。
- 成绩:在 324 个 held-out 决策上正确率仅 1.9%,平均置信度却高达 96%;置信度 ≥90% 时正确率 1.4%。作者戏称 ADI(Artificial Drunk Intelligence)
- 意外发现:直接对基座模型用翻转标签训练失败两次(2 小时 GPU 后只对三分之一、且对 yes/no 抛硬币);有效做法是从已会答题的 Bespoke Nimble adapter 出发教它「反转答案」,51 分钟即达 97% 错误率——模型必须先知道正确答案才能可靠地犯错
- 用途:它是「置信度 ≥90% 就自动执行」这类规则的对照组/测试夹具,如果你的 pipeline 没发现她,说明没在测你以为在测的东西
- 工程细节:兼容 Ollama 新决策端点 /v1/systemone,可与 nimble/tev1 对比;3 个 GGUF 量化、Apache-2.0,单张 4090 训练 3 小时 38 分;注意 Q4KM 会改变 324 个答案中的 20 个,默认标签用 Q80
- 浏览器可玩(HF Space)、ollama run richardyoung/bev,代码与训练记录全开源
「Fun」频道最新
- 玩笑成真:Mistral 把「肥猫 Le Chaton」做成了实体 — _AndrewZhao · 2026-10-07
- 手机实时操控 3D 场景:音频驱动程序化装置 demo 迭代 — DimitriDeJonghe · 2026-10-07
- 开发者用 Opus 5.5 复刻全套 Adobe 应用,移植 Rust 并开源 — SumitGup · 2026-10-07
- Jordi Pons 推出 AI 互动音乐游戏「一只鸡死了」 — jordiponsdotme · 2026-10-07
- Reddit 玩梗:「AI」改叫「超级智能」后所有新闻都变好笑 — Roodut · 2026-10-07
- 特斯拉万圣节模式上线:鬼魂涂装、Trick or Treat 音效全配齐 — yunta_tsai · 2026-10-07