Anthropic 调整 Claude 分类器,误报率降低约 85%
dl_weekly · x · 2026-08-14
Anthropic 重写了 Claude Fable 5 生物学分类器的底层规则,成功将误报率降低了约 85%。
这反映了 AI 安全机制中的一种常见权衡:在产品早期先部署覆盖面广但略显粗糙的安全护栏,随后再通过技术迭代逐步提升精确度。
「模型」频道最新
- Vercel 为 eve agents 免费提供 GLM 5.2 模型 — cramforce · 2026-08-14
- Deepgram 营收破 1 亿美元,发布 Flux TTS 语音模型 — deepgramscott · 2026-08-14
- Grok 4.6 发布引爆用量,马斯克宣布重置并提供更多免费额度 — EricBuess · 2026-08-14
- a16z 合伙人实测 Grok 4.6:长任务与复杂代码能力出色 — elonmusk · 2026-08-14
- 前沿大模型 Token 价格一览:侧面折射模型规模差异 — sergeykarayev · 2026-08-14
- Meta 发布 Muse Glimmer:30B 参数本地智能体模型 — ollama · 2026-08-14