新模型在 AA 基准测试得 55 分,表现尚可但略逊预期
teortaxesTex · x · 2026-08-13
据 Sol 基于最新重缩放的 AA 基准测试(rescaled AA)以及开发者自测数据估算,某新模型的得分约为 55 分。作者认为这一成绩虽然具备一定竞争力,但仍然略低于此前的期望。
「模型」频道最新
- DeepSeek API 模型指纹疑变更,或已上线新版本 — teortaxesTex · 2026-08-13
- 用户反馈 Google 模型近期严重降智 — EthanBeMe · 2026-08-13
- 通义千问 Qwen3.8-27B 模型已上线 ModelScope — Ok-Shower7286 · 2026-08-13
- 网传 Grok 4.6 发布:Agent 能力领先,编程反超 GPT-5.6 — rohanpaul_ai · 2026-08-13
- 传 Claude 将为所有输出嵌入隐形水印 — AccBalanced · 2026-08-13
- 用户困惑:AI Plus 订阅为何能用 Gemini Pro? — SternButFaiir · 2026-08-13