Licensed to be used in conjunction with basebox, only.
// installation
Dedizierte Service-GPU
Gilt für
Produkt: Server · Zielgruppe: Platform Operator
Eine GPU (oder MIG-Slices) ausschließlich für Service-Modelle reservieren, damit Uploads und Transkriptionen nie mit der Inferenz konkurrieren. Das ist das Architekturprinzip hinter allen Referenzkonfigurationen: Die Inferenz bekommt komplette GPUs, die Service-Modelle bekommen eigene Kapazität – und die Plattform braucht keine.
Das Problem, das es löst
Service-Modelle – GPU-RAG, Dokumentextraktion, OCR, Sprache-zu-Text – arbeiten stoßweise: Ein Upload, ein 120-seitiges PDF, eine einstündige Transkription. Teilen sie sich die GPU mit der Inferenz, konkurrieren sie in genau diesen Momenten um VRAM und Rechenleistung, und Nutzer sehen Latenzspitzen im Chat – oder die Inferenz läuft in einen OOM-Fehler. Service-Modelle haben dagegen einen stabilen, vorhersehbaren Fußabdruck; getrennt sind sie leicht zu dimensionieren.
Drei Wege
| Weg | Wie | Status | Referenz |
|---|---|---|---|
| A · MIG-Slices einer großen GPU | Eine H200/H100 im MIG-Modus, eine Instanz je Dienst; die Inferenz-GPU(s) bleiben komplett | Validated | 2 × H200 (4 × 1g.35gb), 4 × H100 (2 × 2 × 3g.40gb) |
| B · Eigene physische GPU | Eine zusätzliche Karte (z. B. RTX PRO 6000, 96 GB) nur für Service-Modelle | Supported | 2 × H200 + RTX PRO 6000, 3 × RTX PRO 6000 |
| C · Freie GPU aus TP-Einschränkungen | Nutzt das LLM z. B. TP=2 von vier GPUs, dient eine der übrigen den Services | Supported | LLM-Empfehlungen → GPU-Zuteilung |
Ohne freie GPU-Kapazität bleibt der CPU-Modus – funktionsfähig für RAG und OCR, deutlich langsamer (Service-Modelle bereitstellen).
Weg A: MIG
- Service-GPU per UUID identifizieren (
nvidia-smi -L); Inferenz-GPU(s) nicht anfassen. - MIG auf der Service-GPU aktivieren, Instanzen im vorgesehenen Profil anlegen (
1g.35gbauf H200,3g.40gbauf H100 –nvidia-smi mig -lgipzeigt, was die GPU kann) und Compute-Instanzen erzeugen. - GPU Operator auf gemischte Erkennung (
mixed) stellen, Erkennungskomponenten neu laden. - Prüfen, dass der Knoten komplette GPUs und MIG-Ressourcen anbietet:
- Jeder Service-Workload fordert eine Instanz an:
Schritt-für-Schritt und Fehlerbilder: NVIDIA / GPU → MIG. MIG isoliert Rechenleistung und Speicher zwischen den Instanzen; Dienste auf derselben physischen GPU teilen sich weiterhin deren Leistungs- und Wärmebudget.
Weg B: eigene physische GPU
Die Service-Dienste müssen auf dieser Karte landen und die Inferenz-GPUs frei lassen:
- Entweder auch hier MIG auf der Service-GPU (wenn die Karte es unterstützt) – dann greift Weg A, und die Inferenz kann die Service-GPU gar nicht bekommen, weil sie nur MIG-Ressourcen anbietet.
- Oder Geräteauswahl: Inferenz und Service-Dienste über Knoten-Labels bzw. eine Device-Plugin-Konfiguration, die die Service-GPU als eigene Ressource ausweist, gezielt platzieren. Welche Variante basebox für die RTX-PRO-6000-Konfigurationen vorsieht, steht unter DevOps-Vorbehalt.
Ohne eine dieser Maßnahmen kann Kubernetes nvidia.com/gpu: 1 der Inferenz auf die Service-Karte legen – und umgekehrt.
Dimensionierung
Als Architektur-Orientierung, nicht als Mindestanforderung: etwa 48 GB GPU-Speicher, besser rund 96 GB für größere Nutzungsszenarien, abhängig von aktivierten Diensten und Volumen. Die MIG-Varianten geben je Dienst 35 GB (H200) bzw. 40 GB (H100). Whisper braucht etwa 8 GB. Gemessene Anhaltspunkte der 2 × H200: 120-seitiges PDF in 28,47 s, 60 Minuten Audio in 31,31 s.
Welche Dienste auf die Service-GPU
| Dienst | Komponente |
|---|---|
| GPU-RAG (Embeddings, Retrieval, Reranking) | ragsrv |
| Dokumentextraktion | ragsrv-support |
| OCR | ragsrv-support bzw. separater OCR-Modell-Endpunkt |
| Sprache-zu-Text | Whisper-Endpunkt (AISRV_WHISPER_URL) |
Zuordnung und Values: Service-Modelle bereitstellen · Service-Modelle.
Prüfen
- Knoten bietet die erwarteten Ressourcen an (
kubectl describe node). - Inferenz-Pod hält nur komplette GPU(s); jeder Service-Pod hält seine Instanz/Karte (
describe pod | grep nvidia.com/). - Mischlast: während ein großes PDF verarbeitet und eine Audiodatei transkribiert wird, bleibt die Chat-Latenz stabil und der Speicher der Inferenz-GPU unverändert (
nvidia-smi dmon). - Nach Neustart kehren MIG-Layout und Zuteilung zurück.
Häufige Fehlerbilder
| Symptom | Ursache | Lösung |
|---|---|---|
| Chat wird langsam bei Uploads | Services teilen die Inferenz-GPU | Dedizierte Kapazität nach Weg A/B |
Service-Pod Pending |
MIG-Ressource nicht angeboten oder falscher Name | Erkennung mixed, Ressourcenname exakt |
| Inferenz belegt die Service-Karte | Keine Geräteauswahl (Weg B) | MIG oder Device-Auswahl |
| MIG nach Neustart weg | Layout nicht persistent | MIG-Konfiguration beim Boot anwenden (z. B. nvidia-mig-parted/GPU-Operator-MIG-Manager) |
Nächster Schritt: Mehrere Inferenz-Instanzen