Zum Inhalt

// installation

Referenzkonfiguration: 3 × NVIDIA RTX PRO 6000

Gilt für

Produkt: Server · Betrieb: durch den Kunden oder durch basebox · Zielgruppe: Platform Operator · Hardware: 3 × NVIDIA RTX PRO 6000 · Architektur: Einzelner Knoten

Was eine Referenzkonfiguration ist

Eine Referenzkonfiguration dokumentiert ein konkretes, bekanntes Setup. Sie bedeutet nicht, dass basebox diese Hardware benötigt – die GPUs dienen den Service-Modellen und der Inferenz. Gemeinsame Installationsschritte werden hier nicht wiederholt; sie stehen im Bare-Metal-Installationsleitfaden.

Eine Drei-GPU-Konfiguration der Workstation-Klasse, angeboten von FAST LTA mit 128 GB oder 512 GB Arbeitsspeicher. Typische Aufteilung: eine GPU dediziert für die Service-Modelle, die übrigen zwei GPUs für die Inferenz – einzeln für zwei Modelle oder als tensor-paralleles Paar für ein größeres Modell. Das ist die günstigste der FAST-LTA-Konfigurationen und für mittlere Organisationen ausgelegt.

Status

Supported – siehe Status-Begriffe. basebox unterstützt dieses Setup; ein gemessener Referenz-Workload wie bei den Validated-Konfigurationen liegt noch nicht vor.

Architektur

Einzelner Kubernetes-Knoten mit allen drei GPUs.

GPU

Physische GPU Rolle Speicher (NVIDIA-Spezifikation)
RTX PRO 6000 GPU 0 Inferenz 96 GB GDDR7
RTX PRO 6000 GPU 1 Inferenz 96 GB GDDR7
RTX PRO 6000 GPU 2 Service-Modelle 96 GB GDDR7

Zwei Inferenz-GPUs mit je 96 GB liegen in der VRAM-Klasse der 4 × L40S (192 GB gesamt): dort sind etwa GPT-OSS 120B AWQ (TP über alle Inferenz-GPUs) oder Llama 3.3 70B FP8 mit 32–65k Kontext dokumentiert. Übertragen Sie das als Orientierung, nicht als Messung – Interconnect und Speicherbandbreite unterscheiden sich.

Arbeitsspeicher

128 GB oder 512 GB (FAST-LTA-Optionen).

basebox-Version

Noch nicht von basebox auf dieser Konfiguration gemessen. Verwenden Sie das aktuelle Release (Chart 0.3.32 → basebox 1.8.8).

Getestet am

Keine Messung dokumentiert.

Komponenten-Platzierung

Komponente Platzierung
basebox-Plattform CPU des Knotens
Inferenz (vLLM) GPU 0 (+ GPU 1 bei TP=2 oder als zweite Instanz)
GPU-RAG, Dokumentextraktion, OCR, Sprache-zu-Text GPU 2

Platzierung der Service-Modelle

Alle Service-Modelle auf GPU 2, getrennt von der Inferenz – das Muster Dedizierte Service-GPU. Die Aufteilung der 96 GB zwischen ragsrv, ragsrv-support und OCR-/STT-Endpunkten steht unter DevOps-Vorbehalt.

Inferenz-Konfiguration

Backend vLLM. Zwei Optionen: (a) TP=2 über GPU 0 und 1 für ein großes Modell mit langem Kontext; (b) zwei Instanzen je eine GPU – etwa ein Hauptmodell und ein zweites für Reasoning oder eine App – siehe Mehrere Inferenz-Instanzen. Richtwerte: LLM-Empfehlungen.

Getestete Modelle

Keine dokumentierte Modellprüfung für diese Konfiguration.

Abweichungen von der Standardinstallation

  • Inferenz fordert nvidia.com/gpu: 2 mit NUM_GPUS: "2" (TP=2) oder zwei Deployments mit je nvidia.com/gpu: 1 an.
  • Service-Modelle fordern GPU-Ressourcen auf GPU 2 an; GPUs per UUID/PCI-Adresse zuordnen.

Bekannte Einschränkungen

  • Workstation-Klasse: kein NVLink/NVSwitch wie bei H100 SXM; Tensor-Parallelismus über PCIe ist möglich, aber langsamer im Austausch zwischen den Shards. Peer-Pfad mit nvidia-smi topo -m prüfen.
  • Leistungs- und Wärmebudget für drei GPUs mit dem Hersteller bzw. FAST LTA freigeben.
  • Keine Hochverfügbarkeit über mehrere Knoten.

Verwandte Seiten