实测 34 个 LLM API 两个月,抓到 DeepSeek 暗改推理成本涨 3 倍
Electrical_Rip892 · reddit · 2026-10-01
一位开发者自 8 月 20 日起,每天用固定探针集测 15 家实验室的 34 个 hosted 模型,比对各模型自身历史,评分用纯代码(非 LLM judge),每条读数即时写入 Rekor 存证。
抓到的变化:
- 9 月 10 日 deepseek-reasoner 在两组探针上思考 token 跳到平时的 10-12 倍——正是 DeepSeek 发布 V4.1 Flash 当天。changelog 对 reasoner 别名只字未提,无法判断是同名的全新模型还是仅 effort 默认值变化。
- 答案相同,但 token 多、更慢更贵:日均成本从约 7 美分涨到 25 美分,此后稳定在约 3 倍。用它的部署方在毫无公告的情况下吃了成本和延迟变化。
没抓到的:任何模型能力悄悄下滑,包括 Opus 5.5 发布以来——该系统刻意保守,应读作「没有大变化」而非「没有任何变化」。
两条可复用建议:
- 探针分两组:固定集 + 每次从同一任务族重新生成的动态集,防模型背题;两组的差距本身就是信号——板上一个模型固定集 1.00、动态集仅 0.76。
- 把思考 token 当一等指标追踪,它比准确率更早、更剧烈地变动。
工具(MIT)与数据(CC BY)已开源:seismograph 仓库与实时看板在线可用。
所属事件:开发者每日探测 34 个 LLM API,抓出 DeepSeek 静默变更(2 条相关)→
「编程与Agent」频道最新
- 开发者吐槽:CI 与 GitHub 上演「谁更拖慢我」之争 — garrytan · 2026-10-01
- universal-modder:让 Claude Code 给任意 PC 游戏做 Mod 的技能包 — Aryvyo · 2026-10-01
- 一条 Prompt 让 AI 把个人照片剪成 60 秒吉卜力风短片 — henloitsjoyce · 2026-10-01
- Celesto CI 宣称比 GitHub Actions 便宜 12 倍,主打面向 Agent 的 CI — aniketmaurya · 2026-10-01
- $200 Codex Pro 新额度池挤压代码评审:还剩 28% 周额度却提示超限 — EffectiveWebDev404 · 2026-10-01
- NVIDIA VSS 3.3:一个提示词 30 分钟造出产线视觉 AI Agent — NVIDIAAI · 2026-10-01