跑了几十小时端到端基准,Strata 推理服务器在完整构建任务上翻车
julianharris · x · 2026-10-06
作者 julianharris 长期运行端到端基准:用极详细规格让模型完整实现功能(含任务与测试),单次数十小时、每组跑 5 次取统计,已把「Miro clone MVP」跑过 50 多次,积累跨硬件(M5 Max、AMD Strix)与软件栈(Swift、MTPLX、gufo 等)的对话与日志数据库。
新推理服务器 Strata 目标是在有限内存上跑大模型,能通过全部 smoke tests,但在「完整构建」场景中直接崩掉,作者决定 n=1 后弃用。此前同一套基准已在一周内发现 gufo 和 MTPLX 的重要 bug。详细失败原因分析将于其博客后续公布。
所属事件:Strata推理服务器通过冒烟测试却在长跑基准中翻车(2 条相关)→
「编程与Agent」频道最新
- Replit CEO:有人挂 AI Agent 睡一觉醒来烧掉一万美元 token — amasad · 2026-10-06
- Replit 设计负责人开炮:MCP、Harness、Skills 都是多余概念 — shlomifruchter · 2026-10-06
- 一次 prompt 生成完整应用,Spawn 编程智能体实测惊艳开发者 — TAbrodi · 2026-10-06
- 五年代码磨一剑:专为 agent 建模打造的语言 MATHPETS 发布 — jessi_cata · 2026-10-06
- 审计 7 款 LLM 评测工具源码,发现 13 处打分与实际检查不符 — maverick_man1111 · 2026-10-06
- 六个面向团队的开源 Agent 框架盘点,含 Stripe 等案例 — femke_plantinga · 2026-10-06