跑了几十小时端到端基准,Strata 推理服务器在完整构建任务上翻车

julianharris · x · 2026-10-06

作者 julianharris 长期运行端到端基准:用极详细规格让模型完整实现功能(含任务与测试),单次数十小时、每组跑 5 次取统计,已把「Miro clone MVP」跑过 50 多次,积累跨硬件(M5 Max、AMD Strix)与软件栈(Swift、MTPLX、gufo 等)的对话与日志数据库。

新推理服务器 Strata 目标是在有限内存上跑大模型,能通过全部 smoke tests,但在「完整构建」场景中直接崩掉,作者决定 n=1 后弃用。此前同一套基准已在一周内发现 gufo 和 MTPLX 的重要 bug。详细失败原因分析将于其博客后续公布。

所属事件:Strata推理服务器通过冒烟测试却在长跑基准中翻车(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →