Whale-chain 测评:代码识别存在严重错误不可信
teortaxesTex · x · 2026-08-22
用户分享了对 Whale-chain 模型的代码测试结果。测试显示,在处理 1571 个 tokens 的 JS 代码截图时,模型出现了严重的代码破坏性错误。用户评价该模型在代码理解上“不可信”,并建议只有在图像被转换为信息密度明确、无歧义的自然渲染形式时,才可能具备一定的可信度。
「模型」频道最新
- VulcanBench 榜单:Grok 4.5 High 居首,高 effort 并不等于高精度 — elonmusk · 2026-08-22
- 爆料:GLM 5.3 Flash 源自蒸馏与强化学习 — teortaxesTex · 2026-08-22
- Grok 语音模型登顶新基准,任务成功率第一 — XFreeze · 2026-08-22
- 评测称 Ox-Alpha 性能不及两代前模型 — bindureddy · 2026-08-22
- 用户称 Claude Opus 5 能力极强且具独特说话风格 — repligate · 2026-08-22
- 文章称模型开始“自我防御”,反思用户关系本质 — repligate · 2026-08-22