本地 LLM 评测乱象:tokens/s 单线程数据基本是噪音
TheZachMueller · x · 2026-10-04
TheZachMueller 指出行业不会认真对待本地 AI 的评测,因为缺少统一报告标准:
- 配置太杂:x4/x8/x16 卡、PCIE 代际不同,大家的硬件环境千差万别,数据不可比。
- 单靠 tokens/s 无意义:并发数 1(c=1)跑分漂亮,但真实服务很少是 c=1;他实测 c=1 可推 300 tok/s,c=8 时每用户只剩 60 tok/s——用 subagent 的场景很快就会到 c=8。
- 建议:本地社区应模仿行业(如 MLPerf 类)的报告规范,定义固定配方(固定硬件基线 + 固定负载),其他人按比例折算。
他的测试环境仅 4x RTX 6000 Pro 和 4x 6000 Max-Q,呼吁建立统一基准站,否则多数本地部署跑分都是噪音。
「编程与Agent」频道最新
- xAI 员工自曝用 50+ 个 Grok bot,靠管理 bot 编排调度 — petergyang · 2026-10-05
- arXiv 论文揭示:个人 Agent 记忆越多反而越容易出错 — rohanpaul_ai · 2026-10-05
- Mac 上的 iOS 模拟器竟能直接跑在手机里,开发者惊呼不知道这功能 — itsOmSarraf_ · 2026-10-05
- 实验:个人 Agent 记忆超 10 行开始失灵,计数任务改用代码零违规 — rohanpaul_ai · 2026-10-05
- Raven V2 让 Rhino/Grasshopper 也能 agentic 建模,已覆盖 1.5 万席位 — burhop · 2026-10-05
- 独立开发者用 AI 全流程做游戏:半月连推三款,一款已上架 App Store — ezshine · 2026-10-05