观点:人们依赖品牌名主观评价模型能力
jd_pressman · x · 2026-08-22
用户指出,人们对模型的主观评价往往严重依赖品牌名称。在个人测试中,该用户使用自己最喜欢的测试题进行验证,发现该模型虽然非常详尽,却陷入了一个其他前沿模型从未给出过的“似是而非的论证”(specious argument)。
所属事件:新模型实测引发社区热议:能力亮眼但评价仍受品牌影响(2 条相关)→
「模型」频道最新
- 实测 ox-alpha:中文提问后否认由智谱等研发 — zainhas · 2026-08-22
- Ox Alpha模型实测:单次生成6.4万token构建3D场景 — rohanpaul_ai · 2026-08-22
- Codex 与 Claude 为何痴迷计算哈希值? — zhengyiluo · 2026-08-22
- GLM 5.3 等 3 模型 Terminal-Bench 3 测试结果与 DeepSWE 表现相反 — zainhas · 2026-08-22
- 测模型猜人设:Claude 盘问本人,Grok 只刷推文 — repligate · 2026-08-22
- Opus 5 技能点侧重编程与哲学,意图理解能力突出 — davidad · 2026-08-22