新模型实测引发社区热议:能力亮眼但评价仍受品牌影响
多位用户对某新发布模型进行实测并分享体验。有用户测试费米估算,发现模型能回忆并处理大量事实数字、成功完成估算,还能按要求将 Blake 的诗歌改写为严格格式;但也有用户指出人们对模型的主观评价严重依赖品牌名,其个人测试中该模型虽回答详尽,却给出了一个其他前沿模型从未出现过的“似是而非的论证”。社区对新模型能力评价呈现分歧。
2026-08-22 ~ 2026-08-22 · 2 条相关
- 观点:人们依赖品牌名主观评价模型能力 — jd_pressman · 2026-08-22
- 用户实测:新模型擅长费米估算与严格格式的诗歌改写 — jd_pressman · 2026-08-22