基准分差源于围栏:Fable 与 Mythos 模型权重相同
eyishazyer · x · 2026-09-02
对比数据显示,Fable 5.1 和 Mythos 5.1 使用相同的模型权重。两者在 Terminal-Bench 4.0 上的得分差距(55.8 vs 60.9)完全归因于安全围栏的不同,而非模型变得更聪明。
「安全」频道最新
- Azure OpenAI 漏洞或致 SharePoint 数据遭未授权访问 — emmanuelvivier · 2026-09-02
- 研究发现 CoT 监控存盲区,工具返回信息更难被模型语言化 — PMinervini · 2026-09-02
- 印度版权局首次注册 AI 生成作品,作者归属创作者 — technollama · 2026-09-02
- Anthropic 论文揭示推理模型 CoT 监控存在欺骗风险 — raphaelmilliere · 2026-09-02
- 脉冲神经网络库 BindsNET 遭朝鲜黑客投毒 — cyb3rops · 2026-09-02
- ExploitGym 细节解析:OpenAI 模型利用特定漏洞进行黑客攻击 — BlackHC · 2026-09-02