28 天追踪 7 万条回答:ChatGPT 与 AI Overviews 波动性实测
gaganghotra_ · x · 2026-09-26
Glen Allsopp(Detailed.com)发布了一项跨度 28 天的大型实测:每天检查 1300+ 条提示词在 ChatGPT 和 Google AI Overviews 中的回答,累计超过 7 万条响应。
- 提示词以商业类为主,基于有传统搜索量的关键词改写成对话式提问,例如「观星最好的双筒望远镜」「悉尼最好的数字营销机构」等,覆盖产品、机构、软件等品类。
- 研究动机:同一问题几秒内重复提问,AI 给出的品牌推荐和引用链接都可能不同,他想验证哪些部分长期稳定——此前 2 月的初步研究发现,完全一致罕见,但最常被提及的品牌出现频率较高。
- 作者也坦承方法局限:提示词并非真实用户场景(真实请求常以追问形式出现),品牌方实际应跟踪与自身业务相关的提示词。
这项研究对做 AI 搜索优化(GEO/AEO)和品牌投放效果评估的从业者有直接参考价值。
「模型」频道最新
- Peter Steinberger:编码不用 Claude,靠 Codex 加 OC harness — steipete · 2026-09-26
- Anthropic 数学解题落后 OpenAI,算力储备或是主因 — haider1 · 2026-09-26
- Opus 4.6 对比 Opus 5.5:实测两代模型生成 Hytale 世界观 — Angaisb_ · 2026-09-26
- Proof Bench 实测:Opus 5.5 中档推理性价比偏低,Astra 表现超预期 — JenniferHli · 2026-09-26
- 数据泄露曝光 Anthropic 新模型 Mythos,官方称能力跃升一代 — Miles_Brundage · 2026-09-26
- 用户实测称新模型 Sol 写作与推理质量明显跃升 — dreamwieber · 2026-09-26