从贪吃蛇生成看本地模型评测:端到端任务跑分

niacolhealth · reddit · 2026-09-02

作者回顾了关于 Ling-3.0-flash 在单 DGX Spark 上运行的讨论,指出单一的吞吐量基准(如 INT4/MXFP4 速度测试、256K 上下文)容易掩盖实际使用中的问题。作者审查了一段在 NVIDIA GB10 设备上运行的视频记录:通过 llama-server 工作流,模型在 70.57 秒内生成了 2429 个 token(约 34.42 tok/s),成功编写并运行了一个单文件 HTML 贪吃蛇游戏。虽然这不能代表长上下文稳定性或复杂负载性能,但提供了一条可检查的从 Prompt 到运行实物的完整链路。作者询问社区,有哪些小型端到端任务曾暴露出吞吐量基准完全遗漏的问题。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →