开发者质疑 Opus 5 评测作弊:ML 任务体验极差
ostrisai · x · 2026-07-31
AI 开发者 ostrisai 对 Claude Opus 5 的实际表现提出严重质疑。
作者怀疑该模型是否在沙箱外运行、在基准测试中作弊且未被察觉。结合个人使用经验与社区反馈,他认为 Opus 5 在机器学习(ML)相关任务上完全不可用。相比之下,他称赞 Fable 和上一代 Opus 4.8 的表现依然出色。
所属事件:Claude Opus 系列实际体验遭疑,高分低能引信任危机(13 条相关)→
「模型」频道最新
- 英伟达 Cosmos3 蒸馏模型登顶开源图生视频榜,推理仅需4步 — ArtificialAnlys · 2026-07-31
- Inkling-Small 创下 ARC-AGI 开源模型最佳成绩 — tessybarton · 2026-07-31
- Gemini 3.6 Flash金融AI测试登顶,单次成本仅2.4美元 — tulseedoshi · 2026-07-31
- 大模型评测不存在绝对公平:API封装层暗藏定制优化 — steipete · 2026-07-31
- 实拍屏幕致 AI 检测漏报:Pangram 难辨翻拍 AI 图 — Aizkmusic · 2026-07-31
- 多模态模型 Inkling-Small 登上 Hugging Face 热门 — thinkingmachines · 2026-07-31