Licensed to be used in conjunction with basebox, only.
// installation
Referenzkonfiguration: 3 × NVIDIA RTX PRO 6000
Gilt für
Produkt: Server · Betrieb: durch den Kunden oder durch basebox · Zielgruppe: Platform Operator · Hardware: 3 × NVIDIA RTX PRO 6000 · Architektur: Einzelner Knoten
Was eine Referenzkonfiguration ist
Eine Referenzkonfiguration dokumentiert ein konkretes, bekanntes Setup. Sie bedeutet nicht, dass basebox diese Hardware benötigt – die GPUs dienen den Service-Modellen und der Inferenz. Gemeinsame Installationsschritte werden hier nicht wiederholt; sie stehen im Bare-Metal-Installationsleitfaden.
Eine Drei-GPU-Konfiguration der Workstation-Klasse, angeboten von FAST LTA mit 128 GB oder 512 GB Arbeitsspeicher. Typische Aufteilung: eine GPU dediziert für die Service-Modelle, die übrigen zwei GPUs für die Inferenz – einzeln für zwei Modelle oder als tensor-paralleles Paar für ein größeres Modell. Das ist die günstigste der FAST-LTA-Konfigurationen und für mittlere Organisationen ausgelegt.
Status
Supported – siehe Status-Begriffe. basebox unterstützt dieses Setup; ein gemessener Referenz-Workload wie bei den Validated-Konfigurationen liegt noch nicht vor.
Architektur
Einzelner Kubernetes-Knoten mit allen drei GPUs.
GPU
| Physische GPU | Rolle | Speicher (NVIDIA-Spezifikation) |
|---|---|---|
| RTX PRO 6000 GPU 0 | Inferenz | 96 GB GDDR7 |
| RTX PRO 6000 GPU 1 | Inferenz | 96 GB GDDR7 |
| RTX PRO 6000 GPU 2 | Service-Modelle | 96 GB GDDR7 |
Zwei Inferenz-GPUs mit je 96 GB liegen in der VRAM-Klasse der 4 × L40S (192 GB gesamt): dort sind etwa GPT-OSS 120B AWQ (TP über alle Inferenz-GPUs) oder Llama 3.3 70B FP8 mit 32–65k Kontext dokumentiert. Übertragen Sie das als Orientierung, nicht als Messung – Interconnect und Speicherbandbreite unterscheiden sich.
Arbeitsspeicher
128 GB oder 512 GB (FAST-LTA-Optionen).
basebox-Version
Noch nicht von basebox auf dieser Konfiguration gemessen. Verwenden Sie das aktuelle Release (Chart 0.3.32 → basebox 1.8.8).
Getestet am
Keine Messung dokumentiert.
Komponenten-Platzierung
| Komponente | Platzierung |
|---|---|
| basebox-Plattform | CPU des Knotens |
| Inferenz (vLLM) | GPU 0 (+ GPU 1 bei TP=2 oder als zweite Instanz) |
| GPU-RAG, Dokumentextraktion, OCR, Sprache-zu-Text | GPU 2 |
Platzierung der Service-Modelle
Alle Service-Modelle auf GPU 2, getrennt von der Inferenz – das Muster Dedizierte Service-GPU. Die Aufteilung der 96 GB zwischen ragsrv, ragsrv-support und OCR-/STT-Endpunkten steht unter DevOps-Vorbehalt.
Inferenz-Konfiguration
Backend vLLM. Zwei Optionen: (a) TP=2 über GPU 0 und 1 für ein großes Modell mit langem Kontext; (b) zwei Instanzen je eine GPU – etwa ein Hauptmodell und ein zweites für Reasoning oder eine App – siehe Mehrere Inferenz-Instanzen. Richtwerte: LLM-Empfehlungen.
Getestete Modelle
Keine dokumentierte Modellprüfung für diese Konfiguration.
Abweichungen von der Standardinstallation
- Inferenz fordert
nvidia.com/gpu: 2mitNUM_GPUS: "2"(TP=2) oder zwei Deployments mit jenvidia.com/gpu: 1an. - Service-Modelle fordern GPU-Ressourcen auf GPU 2 an; GPUs per UUID/PCI-Adresse zuordnen.
Bekannte Einschränkungen
- Workstation-Klasse: kein NVLink/NVSwitch wie bei H100 SXM; Tensor-Parallelismus über PCIe ist möglich, aber langsamer im Austausch zwischen den Shards. Peer-Pfad mit
nvidia-smi topo -mprüfen. - Leistungs- und Wärmebudget für drei GPUs mit dem Hersteller bzw. FAST LTA freigeben.
- Keine Hochverfügbarkeit über mehrere Knoten.