METR 被指用 Redwood 概念推理基准评测 Mythos 5.1
dfrsrchtwts · x · 2026-09-02
推文指出,评测机构 METR 似乎使用了 Redwood/Acorn 的概念推理基准(conceptual reasoning benchmark)来评测 Mythos 5.1 模型;并且 METR 这次关于 Mythos 5.1 的文字说明比以往模型卡中的内容更多。属第三方观察,尚未经官方确认。
「模型」频道最新
- Claude Fable 5.1 缓存读取成本降低 75% — rohanpaul_ai · 2026-09-02
- Claude Fable 5.1 发布:性能提升且降价 25%~45% — dr_cintas · 2026-09-02
- Perplexity 接入 Claude Fable 5.1,成本降 37% — perplexity_ai · 2026-09-02
- Anthropic Fable 5.1 系统提示词泄露,长达 27 万字符 — Scobleizer · 2026-09-02
- Fable 5.1 模型集成 Anthropic 统计文本水印 — RaGE_Syria · 2026-09-02
- 多智能体评测缺乏模型间对比,需更多细节 — scaling01 · 2026-09-02