同一 Claude 模型白天黑夜判若两模型,实测揭示静默设置变动
FishingCharming5604 · reddit · 2026-09-24
发帖人对 Claude Opus 5 在同一天间隔几小时问了同样的 40 个问题,发现第二次回答时:查资料频率多约 60%,篇幅多约 50%,「论据来源支持度」评分从 59 升到 90。期间新版本 Opus 5.5 发布,但答案里模型名仍是同一个,另外两个对照模型几乎没变。
作者认为最可能的解释不是换模型,而是模型外围的设置——思考强度、可用工具——被后台静默调整了。结论:对比评测 AI 工具时,要把所有设置(包括你没动过的)记录下来,否则你测的可能不是模型,而是设置。
「模型」频道最新
- StarDoc 开源 TeleOCR 文档解析模型,基于 Qwen2.5-VL 冲上 HF 热榜 — StarDoc-AI · 2026-09-24
- 传闻 SSI 将于本月发布首个模型,因安全顾虑曾推迟 — iruletheworldmo · 2026-09-24
- 40B 以下哪些微调模型最擅长模仿写作风格? — Borkato · 2026-09-24
- Opus 5.5 首日口碑:用户称直接取代了 Astra — kimmonismus · 2026-09-24
- 用户盛赞 Anthropic Opus 5.5,Bolt 视频经 4 轮小改即成片 — seanwbren · 2026-09-24
- 开源多模态决策模型 XOR 发布:基于 Qwen,26 万上下文 — TheMoonMidas · 2026-09-24