Licensed to be used in conjunction with basebox, only.
// installation
Referenzkonfiguration: 2 × NVIDIA H200 + 1 × RTX PRO 6000
Gilt für
Produkt: Server · Betrieb: durch den Kunden oder durch basebox · Zielgruppe: Platform Operator · Hardware: 2 × NVIDIA H200 + 1 × RTX PRO 6000 · Architektur: Einzelner Knoten
Was eine Referenzkonfiguration ist
Eine Referenzkonfiguration dokumentiert ein konkretes, bekanntes Setup. Sie bedeutet nicht, dass basebox diese Hardware benötigt – die GPUs dienen den Service-Modellen und der Inferenz. Gemeinsame Installationsschritte werden hier nicht wiederholt; sie stehen im Bare-Metal-Installationsleitfaden.
Zwei H200 für die Inferenz plus eine RTX PRO 6000, die ausschließlich den Service-Modellen dient (OCR, STT, Embeddings, RAG). Das ist das Muster einer dedizierten Service-GPU ohne MIG: Die Inferenz erhält beide großen GPUs komplett, die Service-Modelle eine eigene physische GPU. Angeboten von FAST LTA mit 128 GB oder 512 GB Arbeitsspeicher.
Status
Supported – siehe Status-Begriffe. basebox unterstützt dieses Setup; ein gemessener Referenz-Workload wie bei den Validated-Konfigurationen liegt für diese Kombination noch nicht vor.
Architektur
Einzelner Kubernetes-Knoten mit allen drei GPUs.
GPU
| Physische GPU | Rolle | Speicher (NVIDIA-Spezifikation) |
|---|---|---|
| H200 GPU 0 | Inferenz | 141 GB HBM3e |
| H200 GPU 1 | Inferenz | 141 GB HBM3e |
| RTX PRO 6000 | Service-Modelle | 96 GB GDDR7 |
Die Inferenz kann eine H200 nutzen und die zweite für ein weiteres Modell oder mehr Parallelität frei halten – oder beide als tensor-paralleles Paar (TP=2) für sehr große Modelle oder lange Kontexte. GPU-Speicher bleibt lokal je Karte; zwei 141-GB-GPUs sind kein 282-GB-Gerät.
Arbeitsspeicher
128 GB oder 512 GB (FAST-LTA-Optionen). 512 GB empfiehlt sich, wenn große Modelle geladen werden und Dokumentverarbeitung parallel läuft.
basebox-Version
Noch nicht von basebox auf dieser Konfiguration gemessen. Verwenden Sie das aktuelle Release (Chart 0.3.32 → basebox 1.8.8).
Getestet am
Keine Messung dokumentiert.
Komponenten-Platzierung
| Komponente | Platzierung |
|---|---|
| basebox-Plattform (frontend, AISRV, storesrv, Keycloak, PostgreSQL) | CPU des Knotens |
| Inferenz (vLLM) | H200 GPU 0 (und GPU 1 bei TP=2) |
| GPU-RAG, Dokumentextraktion, OCR, Sprache-zu-Text | RTX PRO 6000 |
Platzierung der Service-Modelle
Alle Service-Modelle laufen auf der RTX PRO 6000 und berühren die Inferenz-GPUs nicht. Wie die 96 GB unter ragsrv, ragsrv-support und den OCR-/STT-Endpunkten aufgeteilt werden (MIG-Instanzen oder gemeinsame Nutzung der einen GPU), steht unter DevOps-Vorbehalt; das Muster beschreibt Dedizierte Service-GPU.
Inferenz-Konfiguration
Backend vLLM. Modell, Quantisierung, Kontext und Parallelismus richten sich nach dem Zielmodell; die 141-GB-Klasse je GPU erlaubt etwa Llama 3.3 70B FP8 mit langem Kontext auf einer GPU oder GPT-OSS 120B MXFP4 mit TP=2. Richtwerte: LLM-Empfehlungen.
Getestete Modelle
Für diese Konfiguration liegt keine dokumentierte Modellprüfung vor. Getestete Kombinationen anderer Konfigurationen: Getestete Modelle.
Abweichungen von der Standardinstallation
- Inferenz fordert
nvidia.com/gpu: 1(oder2mitNUM_GPUS: "2"für TP=2) an. - Service-Modelle fordern GPU-Ressourcen auf der RTX PRO 6000 an – als MIG-Ressourcen oder als
nvidia.com/gpumit Knoten-/Geräteauswahl, je nach bestätigtem Layout. - GPUs anhand stabiler UUID oder PCI-Adresse zuordnen (
nvidia-smi -L), nicht anhand von Indexnummern.
Bekannte Einschränkungen
- Hochverfügbarkeit über mehrere Knoten ist nicht Teil dieser Konfiguration.
- Die RTX PRO 6000 ist eine Workstation-Klasse-GPU; Leistungs- und Wärmebudget des Servers müssen alle drei GPUs bei ihren konfigurierten Grenzen tragen – mit dem Hersteller bzw. FAST LTA freigeben.
- Kapazität hängt von Modell, Kontextlänge, Dokument-Workload und Verkehrsmuster ab; das kundenspezifische Sizing wird im Solution Design abgeschlossen.