反驳 Gemini 3.6 Flash 退步论:被指评测不严谨
DevToD4 · x · 2026-07-22
针对近期关于 Gemini 3.6 Flash 能力退步的批评,开发者 Maestro Alvarez 发文反驳,认为相关的基准测试对比是「拿苹果比橘子」。他指出原评测混淆了不同的努力模式和工作负载,且未展示误差范围,同时成本宣称也有误。他强调,仅凭某项回归测试的低分来否定模型,是忽视生产力提升的片面行为。
「模型」频道最新
- Kimi K3 被称在 ALE-Bench 上接近 Opus 4.8 — scaling01 · 2026-07-22
- 腾讯混元 Hy3 在 Agent Arena 排到开源模型第 5 — arena · 2026-07-22
- 前沿模型正变成规划器,便宜模型负责执行 — bigdata · 2026-07-22
- 他用 n8n 和 Claude 搭了 47 个 Agent,只靠 3 个提示词 — Aiden_Tech_Ai · 2026-07-22
- Reddit 用户称微软 Mageflow 4B 会拦截知名角色提示词 — krigeta1 · 2026-07-22
- 盲测自己的文字,Grok 结果是 0/9 — soulsintention · 2026-07-22