医院内网 MLOps 实战:监控自研与第三方模型
zentax2001 · reddit · 2026-08-22
一位医院 IT 人员分享在完全内网 OpenShift 集群上搭建 MLOps 平台的经验。团队正在评估 Red Hat OpenShift AI 和 ClearML,主要痛点在于生产环境监控。由于受欧盟医疗器械法规(MDR)和 AI 法案约束,他们必须实现包括数据/预测漂移检测、偏差监控(特别是子群性能)、自定义指标及不可变推理日志在内的完整监控方案。
目前的架构方案是自托管 Evidently AI,通过流水线计算指标并推送到 Grafana。难点在于监控运行在供应商基础设施上的第三方模型:由于无法接触运行时,他们通过合同要求供应商提供所有输入/输出数据流,并在本地构建独立的监控流水线进行验证。
「Infra」频道最新
- Modular 分享 LLVM 2023 演讲:Mojo 系统编程语言解析 — clattner_llvm · 2026-08-22
- Chris Lattner 回击:Modular 是「反 AI 编译器」,tinygrad 类方案从未规模化 — clattner_llvm · 2026-08-22
- 微软 ONNX Runtime 提升跨平台模型推理性能 — microsoft · 2026-08-22
- vLLM 大会下周开幕:与 Google/AMD/NVIDIA 联办 — vllm_project · 2026-08-22
- 两党州长因 AI 怒火放缓数据中心建设 — pstAsiatech · 2026-08-22
- 招人:xAI 与 Oracle 算力团队招募基础设施工程师 — isidentical · 2026-08-22