Zum Inhalt

// installation

Referenzkonfiguration: 2 × NVIDIA H200 + 1 × RTX PRO 6000

Gilt für

Produkt: Server · Betrieb: durch den Kunden oder durch basebox · Zielgruppe: Platform Operator · Hardware: 2 × NVIDIA H200 + 1 × RTX PRO 6000 · Architektur: Einzelner Knoten

Was eine Referenzkonfiguration ist

Eine Referenzkonfiguration dokumentiert ein konkretes, bekanntes Setup. Sie bedeutet nicht, dass basebox diese Hardware benötigt – die GPUs dienen den Service-Modellen und der Inferenz. Gemeinsame Installationsschritte werden hier nicht wiederholt; sie stehen im Bare-Metal-Installationsleitfaden.

Zwei H200 für die Inferenz plus eine RTX PRO 6000, die ausschließlich den Service-Modellen dient (OCR, STT, Embeddings, RAG). Das ist das Muster einer dedizierten Service-GPU ohne MIG: Die Inferenz erhält beide großen GPUs komplett, die Service-Modelle eine eigene physische GPU. Angeboten von FAST LTA mit 128 GB oder 512 GB Arbeitsspeicher.

Status

Supported – siehe Status-Begriffe. basebox unterstützt dieses Setup; ein gemessener Referenz-Workload wie bei den Validated-Konfigurationen liegt für diese Kombination noch nicht vor.

Architektur

Einzelner Kubernetes-Knoten mit allen drei GPUs.

GPU

Physische GPU Rolle Speicher (NVIDIA-Spezifikation)
H200 GPU 0 Inferenz 141 GB HBM3e
H200 GPU 1 Inferenz 141 GB HBM3e
RTX PRO 6000 Service-Modelle 96 GB GDDR7

Die Inferenz kann eine H200 nutzen und die zweite für ein weiteres Modell oder mehr Parallelität frei halten – oder beide als tensor-paralleles Paar (TP=2) für sehr große Modelle oder lange Kontexte. GPU-Speicher bleibt lokal je Karte; zwei 141-GB-GPUs sind kein 282-GB-Gerät.

Arbeitsspeicher

128 GB oder 512 GB (FAST-LTA-Optionen). 512 GB empfiehlt sich, wenn große Modelle geladen werden und Dokumentverarbeitung parallel läuft.

basebox-Version

Noch nicht von basebox auf dieser Konfiguration gemessen. Verwenden Sie das aktuelle Release (Chart 0.3.32 → basebox 1.8.8).

Getestet am

Keine Messung dokumentiert.

Komponenten-Platzierung

Komponente Platzierung
basebox-Plattform (frontend, AISRV, storesrv, Keycloak, PostgreSQL) CPU des Knotens
Inferenz (vLLM) H200 GPU 0 (und GPU 1 bei TP=2)
GPU-RAG, Dokumentextraktion, OCR, Sprache-zu-Text RTX PRO 6000

Platzierung der Service-Modelle

Alle Service-Modelle laufen auf der RTX PRO 6000 und berühren die Inferenz-GPUs nicht. Wie die 96 GB unter ragsrv, ragsrv-support und den OCR-/STT-Endpunkten aufgeteilt werden (MIG-Instanzen oder gemeinsame Nutzung der einen GPU), steht unter DevOps-Vorbehalt; das Muster beschreibt Dedizierte Service-GPU.

Inferenz-Konfiguration

Backend vLLM. Modell, Quantisierung, Kontext und Parallelismus richten sich nach dem Zielmodell; die 141-GB-Klasse je GPU erlaubt etwa Llama 3.3 70B FP8 mit langem Kontext auf einer GPU oder GPT-OSS 120B MXFP4 mit TP=2. Richtwerte: LLM-Empfehlungen.

Getestete Modelle

Für diese Konfiguration liegt keine dokumentierte Modellprüfung vor. Getestete Kombinationen anderer Konfigurationen: Getestete Modelle.

Abweichungen von der Standardinstallation

  • Inferenz fordert nvidia.com/gpu: 1 (oder 2 mit NUM_GPUS: "2" für TP=2) an.
  • Service-Modelle fordern GPU-Ressourcen auf der RTX PRO 6000 an – als MIG-Ressourcen oder als nvidia.com/gpu mit Knoten-/Geräteauswahl, je nach bestätigtem Layout.
  • GPUs anhand stabiler UUID oder PCI-Adresse zuordnen (nvidia-smi -L), nicht anhand von Indexnummern.

Bekannte Einschränkungen

  • Hochverfügbarkeit über mehrere Knoten ist nicht Teil dieser Konfiguration.
  • Die RTX PRO 6000 ist eine Workstation-Klasse-GPU; Leistungs- und Wärmebudget des Servers müssen alle drei GPUs bei ihren konfigurierten Grenzen tragen – mit dem Hersteller bzw. FAST LTA freigeben.
  • Kapazität hängt von Modell, Kontextlänge, Dokument-Workload und Verkehrsmuster ab; das kundenspezifische Sizing wird im Solution Design abgeschlossen.

Verwandte Seiten