Anthropic Fable 放宽过滤后刷新 RareBench 记录
danielmckinn0n · x · 2026-08-21
Anthropic 的 Fable 模型此前因生物相关拒绝而在 RareBench 上得分为 0%。放宽过滤器后,Fable 以 41% + 7% 的成绩夺得榜首,大幅超越 Grok-4.6 此前 4.6% 的记录。作者表示将更新系统重新运行未解决的临床基因组数据,并乐观认为这一突破有助于诊断新患儿。
「模型」频道最新
- 马斯克确认:团队正致力于提升 Grok 的写作技能 — mark_k · 2026-08-21
- 为何「全通过率」是个糟糕的评测指标? — xeophon · 2026-08-21
- ARC Prize 上线模型对比功能,Gemini 3.7 Flash 曝光高分 — mhmazur · 2026-08-21
- NVIDIA 详解 Omni-Model:单一架构通吃文本图像视频与动作 — NVIDIA Developer · 2026-08-21
- 监测显示 Claude Opus 近期行为出现显著变化 — altryne · 2026-08-21
- 用户反馈 GPT-4.1 Sol 模型突然变笨,回答质量显著下降 — M-M103 · 2026-08-21