Published on

KI-Server-Monitoring: Prometheus, Grafana und DCGM

Authors

Monitoring: Das Auge des KI-Administrators

Ein KI-Server ohne Monitoring ist wie ein Auto ohne Tacho — man sieht nicht wann etwas kritisch wird.

Die Monitoring-Stack-Komponenten

KomponenteZweck
PrometheusMetriken-Sammlung
GrafanaVisualisierung & Alerts
DCGM ExporterGPU-Metriken (Temp, Memory, Util)
Node ExporterSystem-Metriken (CPU, RAM, Disk)
cAdvisorContainer-Metriken
Blackbox ExporterHTTP-Health-Checks

Docker Compose: Vollständiger Monitoring-Stack

version: '3.8'
services:
  # Prometheus: Metriken-Sammlung
  prometheus:
    image: prom/prometheus:latest
    volumes:
      - ./prometheus.yml:/etc/prometheus/prometheus.yml
      - prometheus_data:/prometheus
    ports:
      - "9090:9090"

  # Grafana: Visualisierung
  grafana:
    image: grafana/grafana:latest
    ports:
      - "3000:3000"
    volumes:
      - grafana_data:/var/lib/grafana

  # DCGM: GPU-Metriken
  dcgm-exporter:
    image: nvcr.io/nvidia/k8s/dcgm-exporter:latest
    runtime: nvidia
    ports:
      - "9400:9400"

  # Node Exporter: System-Metriken
  node-exporter:
    image: prom/node-exporter:latest
    pid: host
    volumes:
      - /proc:/host/proc:ro
      - /sys:/host/sys:ro

  # cAdvisor: Container-Metriken
  cadvisor:
    image: gcr.io/cadvisor/cadvisor:latest
    volumes:
      - /:/rootfs:ro
      - /var/run:/var/run:ro

volumes:
  prometheus_data:
  grafana_data:

Wichtige Metriken

MetrikAlert-LevelBedeutung
GPU Temperature >85°C⚠️ WarnungKühlung prüfen
GPU Utilization <10%⚠️ WarnungKeine Anfrage?
GPU Memory >90%🔴 KritischOOM-Risiko
API Latenz >5s⚠️ WarnungModell zu groß?
API Error Rate >5%🔴 KritischSystem-Probleme

Grafana Dashboards

DashboardURLZeigt
DCGM ExporterImport-ID: 12236GPU-Temperatur, Memory, Util
Node Exporter FullImport-ID: 1860CPU, RAM, Disk, Network
Docker ContainerImport-ID: 13506Container Health, Restart

Alerting

# prometheus/alert_rules.yml
groups:
  - name: ki-server-alerts
    rules:
      - alert: GPUP过热
        expr: dcgm_gpu_temp > 85
        for: 5m
        annotations:
          summary: "GPU überhitzt"
          description: "GPU {{ $labels.gpu }} Temperatur: {{ $value }}°C"

      - alert: APIHighLatency
        expr: http_request_duration_seconds > 5
        for: 2m
        annotations:
          summary: "Hohe API-Latenz"
          description: "Latenz >5s für {{ $labels.job }}"

Fazit

Monitoring kostet keine €0 und verhindert die meisten Ausfälle. Der Setup kostet ~4h — die Ersparnis bei vermiedenen Ausfällen ist unschätzbar.

👉 KI-Server Guide 👉 Pexon Consulting: Enterprise Monitoring

Quellen & Weiterführende Links

📖 Verwandte Artikel

Weitere interessante Beiträge zu ähnlichen Themen