新模型实测引发社区热议:能力亮眼但评价仍受品牌影响

多位用户对某新发布模型进行实测并分享体验。有用户测试费米估算,发现模型能回忆并处理大量事实数字、成功完成估算,还能按要求将 Blake 的诗歌改写为严格格式;但也有用户指出人们对模型的主观评价严重依赖品牌名,其个人测试中该模型虽回答详尽,却给出了一个其他前沿模型从未出现过的“似是而非的论证”。社区对新模型能力评价呈现分歧。

2026-08-22 ~ 2026-08-22 · 2 条相关