内存超卖监控与调度实践:GPU 分区部署的性能点评
sloppenheimer · x · 2026-09-24
作者点赞某篇部署方案中的评测章节,认为其性能数据非常对味:随时间推移观察 memory overcommit 的表现,整体干净、少争用。他进一步建议把这类统计指标暴露给调度器,有望在大型集群(约 160 节点以上)获得更好的舰队级资源分配收益。补充讨论提到过去用 NVIDIA MIG 配合 vGPU/微虚机的踩坑经历,指出 FnCall 方式可绕过这些限制,并猜测是否有 nvidia-smi 外部重置机制来应对 agent 搞坏 GPU 的情况。
所属事件:网友点评系统论文评测:gVisor 缺席与调度改进建议(2 条相关)→
「编程与Agent」频道最新
- Burkov 发问:换用 Rust 或 C,会不会拖累 LLM 编程能力? — burkov · 2026-09-24
- 用 Jev 做奖励模型跑 RL,24 步把 AI 味奖励从 0.58 提到 0.76 — sophiamyang · 2026-09-24
- 有人用 Codex 10 分钟在旧游戏本上跑通 Qwen 加 Hermes Agent — markjeffrey · 2026-09-24
- Jev + Claude Code 组合走红:100 毫秒内替你拦截危险操作 — PrajwalTomar_ · 2026-09-24
- TensorSharp 结构化读取让本地决策 API 快 3.3 倍且零解析失败 — fuzhongkai · 2026-09-24
- Resend 接入 Stripe Projects,成开发者呼声最高邮件服务 — jeff_weinstein · 2026-09-24