Google 推送 Gemma 4 多项改进

多条帖子显示,Google 正根据社区反馈与贡献,为 Gemma 4 推送一轮较大的改进,重点覆盖工具调用、聊天准确性与可靠性、视觉理解和推理速度。对依赖本地部署、工具链与 agent 工作流的用户来说,这些更新直接关系到模型是否更稳、更快,以及是否更适合持续执行任务。

关键改进

转述信息普遍提到,Gemma 4 调整了 chat templates,并修复了 tool-calling 相关问题。@IwakuReal 与 @solyarisoftware 还提到,这轮更新减少了模型“偷懒”、回答过早截断或不够完整的情况。视觉方面,多条帖子称模型提升了细粒度图像理解,并增加了与视觉能力相关的资源,其中包括 token 预算管理。

性能与使用提示

性能层面,@IwakuReal 提到 Gemma 4 在 Hopper GPU 上启用了 Flash Attention;@udmrzn 的转述则进一步写为支持 Flash Attention 4,并称推理速度会明显提升。@jocarrasqueira 认为这些变化让 Gemma 4 更适合长时间运行的 agentic 任务;@danielhanchen 的转述还提到,Unsloth 已提醒用户重新下载更新后的模型。

2026-07-16 ~ 2026-07-17 · 7 条相关