Zum Inhalt

// installation

Dedizierte Service-GPU

Gilt für

Produkt: Server · Zielgruppe: Platform Operator

Eine GPU (oder MIG-Slices) ausschließlich für Service-Modelle reservieren, damit Uploads und Transkriptionen nie mit der Inferenz konkurrieren. Das ist das Architekturprinzip hinter allen Referenzkonfigurationen: Die Inferenz bekommt komplette GPUs, die Service-Modelle bekommen eigene Kapazität – und die Plattform braucht keine.

Das Problem, das es löst

Service-Modelle – GPU-RAG, Dokumentextraktion, OCR, Sprache-zu-Text – arbeiten stoßweise: Ein Upload, ein 120-seitiges PDF, eine einstündige Transkription. Teilen sie sich die GPU mit der Inferenz, konkurrieren sie in genau diesen Momenten um VRAM und Rechenleistung, und Nutzer sehen Latenzspitzen im Chat – oder die Inferenz läuft in einen OOM-Fehler. Service-Modelle haben dagegen einen stabilen, vorhersehbaren Fußabdruck; getrennt sind sie leicht zu dimensionieren.

Drei Wege

Weg Wie Status Referenz
A · MIG-Slices einer großen GPU Eine H200/H100 im MIG-Modus, eine Instanz je Dienst; die Inferenz-GPU(s) bleiben komplett Validated 2 × H200 (4 × 1g.35gb), 4 × H100 (2 × 2 × 3g.40gb)
B · Eigene physische GPU Eine zusätzliche Karte (z. B. RTX PRO 6000, 96 GB) nur für Service-Modelle Supported 2 × H200 + RTX PRO 6000, 3 × RTX PRO 6000
C · Freie GPU aus TP-Einschränkungen Nutzt das LLM z. B. TP=2 von vier GPUs, dient eine der übrigen den Services Supported LLM-Empfehlungen → GPU-Zuteilung

Ohne freie GPU-Kapazität bleibt der CPU-Modus – funktionsfähig für RAG und OCR, deutlich langsamer (Service-Modelle bereitstellen).

Weg A: MIG

  1. Service-GPU per UUID identifizieren (nvidia-smi -L); Inferenz-GPU(s) nicht anfassen.
  2. MIG auf der Service-GPU aktivieren, Instanzen im vorgesehenen Profil anlegen (1g.35gb auf H200, 3g.40gb auf H100 – nvidia-smi mig -lgip zeigt, was die GPU kann) und Compute-Instanzen erzeugen.
  3. GPU Operator auf gemischte Erkennung (mixed) stellen, Erkennungskomponenten neu laden.
  4. Prüfen, dass der Knoten komplette GPUs und MIG-Ressourcen anbietet:
    nvidia.com/gpu:          1      (2 × H200)
    nvidia.com/mig-1g.35gb:  4
    
  5. Jeder Service-Workload fordert eine Instanz an:
    resources:
      requests: {nvidia.com/mig-1g.35gb: 1}
      limits:   {nvidia.com/mig-1g.35gb: 1}
    

Schritt-für-Schritt und Fehlerbilder: NVIDIA / GPU → MIG. MIG isoliert Rechenleistung und Speicher zwischen den Instanzen; Dienste auf derselben physischen GPU teilen sich weiterhin deren Leistungs- und Wärmebudget.

Weg B: eigene physische GPU

Die Service-Dienste müssen auf dieser Karte landen und die Inferenz-GPUs frei lassen:

  • Entweder auch hier MIG auf der Service-GPU (wenn die Karte es unterstützt) – dann greift Weg A, und die Inferenz kann die Service-GPU gar nicht bekommen, weil sie nur MIG-Ressourcen anbietet.
  • Oder Geräteauswahl: Inferenz und Service-Dienste über Knoten-Labels bzw. eine Device-Plugin-Konfiguration, die die Service-GPU als eigene Ressource ausweist, gezielt platzieren. Welche Variante basebox für die RTX-PRO-6000-Konfigurationen vorsieht, steht unter DevOps-Vorbehalt.

Ohne eine dieser Maßnahmen kann Kubernetes nvidia.com/gpu: 1 der Inferenz auf die Service-Karte legen – und umgekehrt.

Dimensionierung

Als Architektur-Orientierung, nicht als Mindestanforderung: etwa 48 GB GPU-Speicher, besser rund 96 GB für größere Nutzungsszenarien, abhängig von aktivierten Diensten und Volumen. Die MIG-Varianten geben je Dienst 35 GB (H200) bzw. 40 GB (H100). Whisper braucht etwa 8 GB. Gemessene Anhaltspunkte der 2 × H200: 120-seitiges PDF in 28,47 s, 60 Minuten Audio in 31,31 s.

Welche Dienste auf die Service-GPU

Dienst Komponente
GPU-RAG (Embeddings, Retrieval, Reranking) ragsrv
Dokumentextraktion ragsrv-support
OCR ragsrv-support bzw. separater OCR-Modell-Endpunkt
Sprache-zu-Text Whisper-Endpunkt (AISRV_WHISPER_URL)

Zuordnung und Values: Service-Modelle bereitstellen · Service-Modelle.

Prüfen

  • Knoten bietet die erwarteten Ressourcen an (kubectl describe node).
  • Inferenz-Pod hält nur komplette GPU(s); jeder Service-Pod hält seine Instanz/Karte (describe pod | grep nvidia.com/).
  • Mischlast: während ein großes PDF verarbeitet und eine Audiodatei transkribiert wird, bleibt die Chat-Latenz stabil und der Speicher der Inferenz-GPU unverändert (nvidia-smi dmon).
  • Nach Neustart kehren MIG-Layout und Zuteilung zurück.

Häufige Fehlerbilder

Symptom Ursache Lösung
Chat wird langsam bei Uploads Services teilen die Inferenz-GPU Dedizierte Kapazität nach Weg A/B
Service-Pod Pending MIG-Ressource nicht angeboten oder falscher Name Erkennung mixed, Ressourcenname exakt
Inferenz belegt die Service-Karte Keine Geräteauswahl (Weg B) MIG oder Device-Auswahl
MIG nach Neustart weg Layout nicht persistent MIG-Konfiguration beim Boot anwenden (z. B. nvidia-mig-parted/GPU-Operator-MIG-Manager)

Nächster Schritt: Mehrere Inferenz-Instanzen