Zum Inhalt

// installation

Monitoring

Gilt für

Produkt: Server · Zielgruppe: Platform Operator

Was zu beobachten ist: Pod-Gesundheit, GPU-Auslastung und -Speicher, Inferenz-Latenz, Warteschlangen der Dokumentverarbeitung, Speicher, Zertifikate. Von den Health-Endpunkten der Dienste bis zu Prometheus und NVIDIA DCGM – und welche Alarme Sie mindestens definieren sollten. Der wichtigste Grund: basebox fällt bei ausgefallener Inferenz nicht stillschweigend auf ein anderes Modell zurück; Sie müssen es sehen.

Was Sie beobachten

Bereich Signal Warum
Pods Zustand, Neustartzähler, Pending/CrashLoopBackOff Erstes Symptom fast jeder Störung
Inferenz /health, Latenz, Time-to-first-Token, Tokens/s, Fehlerrate, Warteschlange Nutzer merken Inferenzprobleme sofort; kein Rückfall
GPU Auslastung, Speicherbelegung, Temperatur, Leistungsaufnahme je GPU/MIG-Instanz Speicherdruck → OOM; Hitze → Drosselung
Service-Modelle ragsrv/ragsrv-support gesund; Verarbeitungsstatus von Uploads; Dauer je Dokument/Audio Hängende Verarbeitung blockiert Wissensbasen
Plattform AISRV /health, Keycloak /health/live und /health/ready, Frontend /, Ingress-Fehlerraten Login und Oberfläche
Datenbanken CloudNativePG-Cluster gesund, Replikationsverzögerung, Größe, Connection Pool Wachsen mit Dokumenten und Audit-Log
Speicher Füllstand der PVCs (Datenbanken, Medien, Modell-Caches), /dev/shm Volle Volumes stoppen Uploads und Modell-Downloads
Zertifikate Restlaufzeit des Ingress-Zertifikats; bei cert-manager Zustand der Certificate-Ressourcen Abgelaufenes Zertifikat = kein Login
Knoten CPU, RAM, Disk, Kubelet, Netzwerk Grundlage für alles
Backups Erfolg und Alter des letzten Backups Siehe Backup & Wiederherstellung

Health-Endpunkte

Dienst Endpunkt Port
AISRV /health 8888
Inferenz (vLLM) /health 8000
ragsrv /health 3001
ragsrv-support /health 8000
Keycloak /health/live, /health/ready (mit KC_HEALTH_ENABLED=true) 8080
Frontend / 3000

Schnellprüfung:

kubectl -n basebox get pods -o wide
kubectl -n basebox port-forward svc/aisrv 8888:8888 & curl -s http://localhost:8888/health
kubectl -n basebox port-forward svc/inference 8000:8000 & curl -s http://localhost:8000/health
kubectl -n basebox get events --sort-by='.lastTimestamp' | tail -20

Die Kubernetes-Probes nutzen dieselben Endpunkte; für die Inferenz mit langem initialDelaySeconds (300/180 s), weil das Modellladen Minuten dauert.

Metriken mit Prometheus

Aktivieren Sie die Exporter in den Values:

aisrv:
  env:
    AISRV_METRICS_PORT: "9090"          # Prometheus-Metriken von AISRV
  aisrv-db:
    cluster:
      monitoring:
        enablePodMonitor: true          # CloudNativePG-Metriken; ebenso storesrv-db, ragsrv-db, idp-db

idp:
  env:
    KC_METRICS_ENABLED: "true"          # Keycloak /metrics
    QUARKUS_MICROMETER_ENABLED: "true"
  • GPU: NVIDIA DCGM Exporter (Teil des GPU Operators oder separat) liefert Auslastung, Speicher, Temperatur, Leistung je GPU und MIG-Instanz.
  • Inferenz: vLLM stellt Runtime-Metriken bereit (Anfragen, Latenz, Tokens, Warteschlange, KV-Cache-Nutzung) – Endpunkt der Runtime-Version entnehmen.
  • Kubernetes: kube-state-metrics und node-exporter für Pods, Neustarts, Knotenressourcen.
  • Visualisierung: Grafana; für den Einstieg reichen die Standard-Dashboards von DCGM, CloudNativePG und Kubernetes.

Ohne Prometheus: kubectl top pods -n basebox, kubectl top nodes, nvidia-smi dmon auf dem Host oder im Pod.

Alarme, die Sie mindestens brauchen

Alarm Schwelle (Vorschlag) Warum
Inferenz-Pod nicht Ready oder /health fehlgeschlagen > 2 Minuten Chat funktioniert nicht; kein Rückfall
GPU-Speicher > 90 % anhaltend OOM bei nächster langer Anfrage
GPU-Temperatur Herstellergrenze − 10 °C Drosselung
Inferenz-Latenz (p95) oder Warteschlange Über Ihrem Ziel Kapazität
PVC-Füllstand > 80 % Volles Volume stoppt Uploads/Downloads
CloudNativePG-Cluster nicht healthy Sofort Datenverlustrisiko
Zertifikat läuft ab < 14 Tage Kein Login nach Ablauf
Backup älter als 1 Tag (oder Ihr Ziel) Wiederherstellbarkeit
Knoten NotReady Sofort Einzelknoten = alles

Was Sie nicht überwachen müssen

Die Anwendungsebene – wer was fragt, welche Apps genutzt werden, Verbrauch in Tokens – sehen Administratoren im Dashboard und Audit Log. Das ist ihr Werkzeug, nicht Ihr Monitoring.

Hosting oder Betrieb durch basebox

Beim Hosting bei basebox überwacht basebox das Physische (Strom, Kühlung, Netz); der Software-Stack folgt dem Betriebsmodell. Beim Betrieb durch basebox überwacht basebox, was vertraglich vereinbart ist, und meldet Alarme nach dem vereinbarten Weg – siehe Betrieb durch basebox.

Nächster Schritt: Logging