3.1万条小时级评测:模型跨天波动 8.4 分,是日内波动 3 倍
ionutvi · reddit · 2026-08-29
作者构建了持续评测管线,对 49 个模型标识、31,352 条小时级 benchmark 分数(编码、深度推理、工具调用、高频金丝雀任务)做了统计分析:
- 同一日内波动仅 2.8 分,跨日波动达 8.4 分,约为日内波动的 3 倍,说明单点小时级波动主要是随机性,而以天为窗口的持续变化才是检测性能漂移的更强信号。
- 编码任务实际执行代码而非仅靠模型评判;工具调用测试在隔离 Docker 环境中验证选工具、构造参数、完成工作流;每任务跑 5 次聚合以降噪。
- 检测管线将重复测量聚合成日中位数,再用序贯变点检测,须超过历史方差并满足最小效应阈值才判定为降级或恢复。
- 截图时系统检测到 Gemini 3.1 Flash Lite 持续性能下降 32%,判定为严重事故。
这套系统已开源为 AIStupidLevel(前后端均 MIT),累计 169,858 次 benchmark 运行、8800 万+ token,实时监控 22 个模型、6 家提供商,将模型分为稳定/波动/降级/恢复四类,并驱动一个按当前任务表现、稳定性、延迟与成本选模型的 OpenAI 兼容路由器。
所属事件:3万余条小时级评测揭示大模型跨天分数波动达日内3倍(2 条相关)→
「Infra」频道最新
- 腾讯混元推 Hy4 官方 1-bit 量化,精度几无损失 — lakySK · 2026-08-29
- AI 硕士生求教:Tesla T10 双卡与 Mi50 怎么选? — fightingCookie0301 · 2026-08-29
- AI 导致内存短缺,谷歌收紧 Android 内存要求 — emmanuelvivier · 2026-08-29
- 传英伟达 Rubin Ultra 降级 HBM4,显存堆叠遭削减 — kevinsxu · 2026-08-29
- AI 延迟不止在模型:全链路 19 种模式即将发布 — bibryam · 2026-08-29
- 个人研究者租GPU越来越难,Jarvislabs 推按需 H200 集群 — algo_diver · 2026-08-29