Licensed to be used in conjunction with basebox, only.
// installation
Monitoring
Gilt für
Produkt: Server · Zielgruppe: Platform Operator
Was zu beobachten ist: Pod-Gesundheit, GPU-Auslastung und -Speicher, Inferenz-Latenz, Warteschlangen der Dokumentverarbeitung, Speicher, Zertifikate. Von den Health-Endpunkten der Dienste bis zu Prometheus und NVIDIA DCGM – und welche Alarme Sie mindestens definieren sollten. Der wichtigste Grund: basebox fällt bei ausgefallener Inferenz nicht stillschweigend auf ein anderes Modell zurück; Sie müssen es sehen.
Was Sie beobachten
| Bereich | Signal | Warum |
|---|---|---|
| Pods | Zustand, Neustartzähler, Pending/CrashLoopBackOff |
Erstes Symptom fast jeder Störung |
| Inferenz | /health, Latenz, Time-to-first-Token, Tokens/s, Fehlerrate, Warteschlange |
Nutzer merken Inferenzprobleme sofort; kein Rückfall |
| GPU | Auslastung, Speicherbelegung, Temperatur, Leistungsaufnahme je GPU/MIG-Instanz | Speicherdruck → OOM; Hitze → Drosselung |
| Service-Modelle | ragsrv/ragsrv-support gesund; Verarbeitungsstatus von Uploads; Dauer je Dokument/Audio | Hängende Verarbeitung blockiert Wissensbasen |
| Plattform | AISRV /health, Keycloak /health/live und /health/ready, Frontend /, Ingress-Fehlerraten |
Login und Oberfläche |
| Datenbanken | CloudNativePG-Cluster gesund, Replikationsverzögerung, Größe, Connection Pool | Wachsen mit Dokumenten und Audit-Log |
| Speicher | Füllstand der PVCs (Datenbanken, Medien, Modell-Caches), /dev/shm |
Volle Volumes stoppen Uploads und Modell-Downloads |
| Zertifikate | Restlaufzeit des Ingress-Zertifikats; bei cert-manager Zustand der Certificate-Ressourcen |
Abgelaufenes Zertifikat = kein Login |
| Knoten | CPU, RAM, Disk, Kubelet, Netzwerk | Grundlage für alles |
| Backups | Erfolg und Alter des letzten Backups | Siehe Backup & Wiederherstellung |
Health-Endpunkte
| Dienst | Endpunkt | Port |
|---|---|---|
| AISRV | /health |
8888 |
| Inferenz (vLLM) | /health |
8000 |
| ragsrv | /health |
3001 |
| ragsrv-support | /health |
8000 |
| Keycloak | /health/live, /health/ready (mit KC_HEALTH_ENABLED=true) |
8080 |
| Frontend | / |
3000 |
Schnellprüfung:
kubectl -n basebox get pods -o wide
kubectl -n basebox port-forward svc/aisrv 8888:8888 & curl -s http://localhost:8888/health
kubectl -n basebox port-forward svc/inference 8000:8000 & curl -s http://localhost:8000/health
kubectl -n basebox get events --sort-by='.lastTimestamp' | tail -20
Die Kubernetes-Probes nutzen dieselben Endpunkte; für die Inferenz mit langem initialDelaySeconds (300/180 s), weil das Modellladen Minuten dauert.
Metriken mit Prometheus
Aktivieren Sie die Exporter in den Values:
aisrv:
env:
AISRV_METRICS_PORT: "9090" # Prometheus-Metriken von AISRV
aisrv-db:
cluster:
monitoring:
enablePodMonitor: true # CloudNativePG-Metriken; ebenso storesrv-db, ragsrv-db, idp-db
idp:
env:
KC_METRICS_ENABLED: "true" # Keycloak /metrics
QUARKUS_MICROMETER_ENABLED: "true"
- GPU: NVIDIA DCGM Exporter (Teil des GPU Operators oder separat) liefert Auslastung, Speicher, Temperatur, Leistung je GPU und MIG-Instanz.
- Inferenz: vLLM stellt Runtime-Metriken bereit (Anfragen, Latenz, Tokens, Warteschlange, KV-Cache-Nutzung) – Endpunkt der Runtime-Version entnehmen.
- Kubernetes: kube-state-metrics und node-exporter für Pods, Neustarts, Knotenressourcen.
- Visualisierung: Grafana; für den Einstieg reichen die Standard-Dashboards von DCGM, CloudNativePG und Kubernetes.
Ohne Prometheus: kubectl top pods -n basebox, kubectl top nodes, nvidia-smi dmon auf dem Host oder im Pod.
Alarme, die Sie mindestens brauchen
| Alarm | Schwelle (Vorschlag) | Warum |
|---|---|---|
Inferenz-Pod nicht Ready oder /health fehlgeschlagen |
> 2 Minuten | Chat funktioniert nicht; kein Rückfall |
| GPU-Speicher | > 90 % anhaltend | OOM bei nächster langer Anfrage |
| GPU-Temperatur | Herstellergrenze − 10 °C | Drosselung |
| Inferenz-Latenz (p95) oder Warteschlange | Über Ihrem Ziel | Kapazität |
| PVC-Füllstand | > 80 % | Volles Volume stoppt Uploads/Downloads |
| CloudNativePG-Cluster nicht healthy | Sofort | Datenverlustrisiko |
| Zertifikat läuft ab | < 14 Tage | Kein Login nach Ablauf |
| Backup älter als | 1 Tag (oder Ihr Ziel) | Wiederherstellbarkeit |
| Knoten NotReady | Sofort | Einzelknoten = alles |
Was Sie nicht überwachen müssen
Die Anwendungsebene – wer was fragt, welche Apps genutzt werden, Verbrauch in Tokens – sehen Administratoren im Dashboard und Audit Log. Das ist ihr Werkzeug, nicht Ihr Monitoring.
Hosting oder Betrieb durch basebox
Beim Hosting bei basebox überwacht basebox das Physische (Strom, Kühlung, Netz); der Software-Stack folgt dem Betriebsmodell. Beim Betrieb durch basebox überwacht basebox, was vertraglich vereinbart ist, und meldet Alarme nach dem vereinbarten Weg – siehe Betrieb durch basebox.
Nächster Schritt: Logging