每日探测 34 个 LLM API 抓静默变更:DeepSeek 推理用量一夜涨 10 倍

Electrical_Rip892 · reddit · 2026-09-30

作者自 8 月 20 日起每天用固定的私有探测集对来自 15 家实验室的 34 个模型 API 跑同样的检查,每个模型只与自己的历史对比——不做排名、不用 LLM 评判,全部由代码评分,每次读数即时哈希进公开透明日志,基线时间无从抵赖。

首个实际发现:9 月 10 日起,DeepSeek reasoner 在相同探测题上的思考 token 用量约为此前三周的 10–12 倍,且找不到任何官方公告。这不是模型变差,而是变得更慢更贵——正是用户只觉得「手感不对」却无法证实的静默变更。

其余 33 个模型尚未发现静默能力下降,其中 Opus 5.5 自上线以来表现稳定,这也算一个结果。代码与方法论开源在 GitHub(piperoll/seismograph),实时读数见 seismo.piperoll.org。作者坦承项目仍处早期,并说明了它目前检测不到的东西。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →