AC2 平台开放自训决策模型,毒性检测 F1 从 0.482 提至 0.677
rhythmrg · x · 2026-10-10
AC2 平台宣布用户可训练自己的「决策模型」(Jev-like 模型),针对具体用例定制:
- 架构:以语言模型为骨干(backbone),在其上加一个小型可学习的「决策头」(decision head)。骨干处理输入、问题和答案选项,决策头输出分数并经 softmax 得到选项概率分布。
- 训练方式:接口支持对任意开源模型添加可变尺寸决策头,用 Brier loss 或交叉熵训练,同时更新决策头与语言骨干。
- 实测:以 Perplexity 的 pplx-decider-v1-27b 为起点,在 Civil Comments 数据集 5 万采样点上训练,2 万采样评测集上毒性评论检测 F1 从 0.482 提升到 0.677。
「模型」频道最新
- Delip Rao 质疑微软新模型:为何基准测试不敢比准确率 — deliprao · 2026-10-10
- Gemini 4 Argon 发布:DeepSWE 得分 77.9%,超 Claude Opus 5.5 的 74.2% — dl_weekly · 2026-10-10
- Polymarket 开盘:Anthropic 本月暂停 AI 训练概率仅 28% — Polymarket · 2026-10-10
- Netlify 直播盲测 Anthropic/OpenAI/Mistral 新模型,同题四模型匿名对比 — thisiskp_ · 2026-10-10
- 曝 Google 向内部员工测试 Gemini 4 "Carbon",编码表现「像 Opus 5.5」 — gaganghotra_ · 2026-10-10
- 实测称 max 推理档更贵反而跑输,多数编码任务用 high 就够 — weswinder · 2026-10-10