用户指责 Anthropic 评测数据造假,实际体验缩水
GabGarrett · x · 2026-08-12
有用户在社交媒体上批评 Anthropic 自 4.7 版本以来的模型存在评测数据与实际服务严重脱节的问题。该用户指出,公司发布的公开评测成绩可能是经过“修饰”的,并不能反映真实客户体验。
此外,该用户还声称,自 4.8 版本起,Anthropic 拒绝在公共 API 上进行任何基准测试,这一举动进一步加剧了外界对其模型真实能力的质疑。
「模型」频道最新
- 美财长表态支持开源AI:称其为美国创新胜利 — max_paperclips · 2026-08-12
- TinyTitle:占用不足5MB内存的超轻量聊天标题生成模型 — H-L_echelle · 2026-08-12
- Anthropic 模型水印策略被指存在漏洞:或反成最佳蒸馏目标 — cocktailpeanut · 2026-08-12
- 研究揭示 Grok 模型家族的人格演变轨迹 — DevDminGod · 2026-08-12
- 网友猜测:Sonnet 5 或暂缓涨价以弥补 Opus 5 口碑 — creblohulk · 2026-08-12
- 用户做胰岛素泵安全审计被 OpenAI 频繁拦截,怒斥安全机制过度 — max_paperclips · 2026-08-12