V4.1 Flash 评测:Flash 梯队最强,但幻觉忽好忽坏像开盲盒
teortaxesTex · x · 2026-10-07
网友 @LeroyLi311063 分享对 V4.1 Flash 的使用观察:在 Flash 级模型中整体最强,但幻觉问题拖后腿,表现呈「神仙与虫豸的一体两面」式剧烈波动。
- 有时能解掉只有 Grok 4.7 / Opus 5 级模型才能处理的「钻石级」bug(B 站有人专门用公司屎山真实 bug 做代码审阅节目)
- 有时却连豆包能一次解决的「白银级」bug 都翻车,发挥基本看运气
- 这种幻觉问题也波及 V4 Pro:难的长任务会使其幻觉并崩溃;V4.1 Flash 有改善但仍落后前沿模型,作者因此对 V4.1 Pro 持谨慎态度
「模型」频道最新
- Mistral Large 4 翻车频发?网友提醒先确认 reasoning_effort 已开高 — qtnx_ · 2026-10-07
- 用户实测:Opus 5.5 被高估,编程外仍不及 GPT-6 Astra — haider1 · 2026-10-07
- TypeSafe 发布 Jev 模型:专为软件自动化设计的机器原生智能 — TWIML AI Podcast · 2026-10-07
- Simon Willison 的 llm-mistral 0.16 新增推理模型支持 — Simon Willison · 2026-10-07
- Ollama 上架 Google EmbeddingGemma 2:740M 多模态嵌入模型 — ollama · 2026-10-07
- Reddit 用户吐槽 ChatGPT 频繁误判违规:"对不起,戴夫"式拒绝越来越多 — Crixusgannicus · 2026-10-07