曝 Claude Sonnet 5.5 实测 120-130tps,跑分全绿但未证实
julianharris · x · 2026-10-01
开发者 julianharris 发帖称「Sonnet 5.5」在他自建的 spec-driven 长文基准上持续跑出 120-130 tokens/s,且目前所有任务 100% 通过。他的基准做法是让 LLM 端到端构建完整应用,再用隐藏的 holdout 测试集检验(相当于对模型「严刑拷打」)。
注意:该模型尚未官方发布,「Sonnet 5.5」的命名与成绩均属未证实爆料;帖子附带的 GitHub 链接是 awesome-local-ai 仓库,收录了在 24GB/64GB 等不同硬件上用 llama.cpp、sglang、mtplx 运行 Qwen 等本地模型的配置脚本。
若属实,吞吐与通过率都是明显跃升;建议等官方发布与独立复测后再下结论。
「编程与Agent」频道最新
- Incident Arena:让编程 Agent 值夜班处理线上事故的新基准 — amankhan · 2026-10-01
- 谷歌:Gemini 4 Argon Agent 已迁移 80 万行 C/C++ 代码到 Rust — xennygrimmato_ · 2026-10-01
- OpenAI 拆解新 Agent 栈:Computer Use 超人类速度、Dots 云电脑与 Decisions API — OpenAIDevs · 2026-10-01
- AI 编码 agent 用 WASM 仿真当「裁判」,加速游戏代码移植 — gandamu_ml · 2026-10-01
- RLTL;DR 论文:自生成反馈让 Pass@128=0 的任务破防至 14-31% — burny_tech · 2026-10-01
- Vercel 推 Connect 替代静态密钥,Cloudflare 宣布参展 — michellechen · 2026-10-01