每日探测 34 个 LLM API 抓静默变更:DeepSeek 推理用量一夜涨 10 倍
Electrical_Rip892 · reddit · 2026-09-30
作者自 8 月 20 日起每天用固定的私有探测集对来自 15 家实验室的 34 个模型 API 跑同样的检查,每个模型只与自己的历史对比——不做排名、不用 LLM 评判,全部由代码评分,每次读数即时哈希进公开透明日志,基线时间无从抵赖。
首个实际发现:9 月 10 日起,DeepSeek reasoner 在相同探测题上的思考 token 用量约为此前三周的 10–12 倍,且找不到任何官方公告。这不是模型变差,而是变得更慢更贵——正是用户只觉得「手感不对」却无法证实的静默变更。
其余 33 个模型尚未发现静默能力下降,其中 Opus 5.5 自上线以来表现稳定,这也算一个结果。代码与方法论开源在 GitHub(piperoll/seismograph),实时读数见 seismo.piperoll.org。作者坦承项目仍处早期,并说明了它目前检测不到的东西。
「模型」频道最新
- Gemini 读不了次要日历和自定义任务列表,同生态整合形同虚设 — Here4Zipline · 2026-09-30
- 爆料称 Google Astra 6.1 将于 10 月发布 — iruletheworldmo · 2026-09-30
- Cohere 发布 Embed 5:Pro 与 Fast 双档企业级嵌入模型 — cohere · 2026-09-30
- 评论称智谱旗下 Z.ai 是「中国最接近 Anthropic 的公司」 — pstAsiatech · 2026-09-30
- 用户实测 GPT-6.1 Sol:重度使用额度几乎不掉 — VraserX · 2026-09-30
- 实测 GPT-6.1 Sol 逆向编译游戏,性价比远超预期 — haider1 · 2026-09-30