Smoke 测试全过却败于完整构建:Strata 推理服务器遭长跑基准否决

julianharris · x · 2026-10-06

开发者 julianharris 分享了他对 Strata(一个面向有限内存跑大模型的新型推理服务器)的实测结论:Strata 通过了他所有的 smoke 测试,但在他标志性的端到端「完整构建」场景中表现崩坏,他决定在 n=1 后就砍掉它。

他的基准方法相当硬核:用极详细的 spec(任务+测试)让模型端到端实现整个功能,比如「Miro clone MVP」已重复实现 50 多次;每轮跑数十小时、重复 5 次以获得统计意义,所有对话与日志存入数据库,横跨 M5 Max、AMD Strix 等不同硬件和 Swift、MTPLX、gufo 等软件栈。他表示这套基准最近一周还在 gufo 和 MTPLX 里发现了重要 bug,详细分析将另行发布。

所属事件:Strata推理服务器通过冒烟测试却在长跑基准中翻车(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →