Zum Inhalt

// installation

Hardware-Optionen

Gilt für

Produkt: Server · Zielgruppe: Platform Operator · Einkauf

Woher Server-Hardware kommt: FAST-LTA-/basebox-gelieferte Systeme oder vom Kunden beschaffte Hardware. FAST LTA ist Hardwarepartner, kein eigenes Produkt und kein eigenes Deployment-Modell – ein FAST-LTA-System ist ein basebox Server wie jeder andere.

Zwei Bezugswege

Über FAST LTA beziehen Selbst beschaffen
Was Sie bekommen Ein vorkonfiguriertes System, das basebox als Referenzkonfiguration führt Eigene oder vorhandene Hardware
Status Supported oder Validated je Konfiguration Validated, wenn sie einer gelisteten Konfiguration entspricht; sonst Custom – Prüfung mit basebox
Arbeitsspeicher-Optionen 128 GB oder 512 GB je System Nach Ihrem Bedarf
Vorteil Bekanntes Setup, dokumentierte GPU-Zuteilung, kurze Abstimmung Nutzung vorhandener Investitionen, freie Wahl
Aufwand Gering Prüfung gegen Anforderungen; bei Custom individuelle Abstimmung

Beide Wege führen zur selben Software und demselben Installationsablauf.

Aktuelle FAST-LTA-Konfigurationen

Konfiguration GPUs Typische Aufteilung Status
3 × NVIDIA RTX PRO 6000 3 Workstation-Klasse Dedizierte Service-GPU, übrige für Inferenz Supported
2 × NVIDIA H200 141 GB 2 Rechenzentrums-Klasse 1 Inferenz, 1 als 4 × MIG für Services; gemessener Referenz-Workload Validated
2 × NVIDIA H200 + 1 × RTX PRO 6000 2 + 1 2 Inferenz, RTX PRO 6000 dediziert für Services Supported

Jeweils mit 128 GB oder 512 GB Arbeitsspeicher; der Arbeitsspeicher ist eine Eigenschaft der Konfiguration, keine eigene Konfiguration. Bedeutung der Status: Status-Begriffe.

Selbst beschaffte Hardware

Entspricht sie einer Referenzkonfiguration, gilt deren Status – etwa 4 × NVIDIA H100 SXM 80 GB (Validated; gilt ausdrücklich für SXM, nicht für PCIe oder NVL).

Entspricht sie keiner, ist sie Custom: funktionsfähig möglicherweise, aber erst nach individueller Prüfung mit basebox unterstützt. Dokumentieren Sie das vereinbarte Setup mit der Vorlage Eigene Hardware.

Mindestens erfüllen muss die Hardware, was der Server Preparation Guide und das Chart verlangen:

Komponente Minimum Empfehlung
GPU NVIDIA, Compute Capability 7.0+ (V100, T4, RTX 20xx, A100, L4, H100 …); Treiber kompatibel mit CUDA 13.0 (12.9 als Rückfall) Rechenzentrums-GPUs mit ausreichend VRAM für Modell und Service-Modelle; MIG-fähig, wenn Services per MIG laufen sollen
CPU 8 Kerne 16+ Kerne
Arbeitsspeicher 16 GB 32 GB+, 64 GB+ für große Modelle
Speicher 500 GB 1 TB+ SSD/NVMe für Modelle, Dokumente, Datenbanken
Netzwerk Zugang zur Image-Registry während der Installation oder Offline-Transfer Getrennte Netze für Nutzerzugang und Inferenz, wenn Hosts getrennt sind
Strom und Kühlung Für die GPUs bei ihrer konfigurierten Leistungsgrenze Vom Serverhersteller freigegeben

Was die GPU-Frage wirklich entscheidet

Nicht basebox – sondern Inferenz und Service-Modelle:

  • Inferenz: Modell, Quantisierung, Kontextlänge, Parallelität und Latenzziel bestimmen den VRAM. Orientierung: LLM-Empfehlungen – etwa GPT-OSS 120B MXFP4 auf 4 × H100 oder GPT-OSS 20B auf einer 24-GB-GPU.
  • Service-Modelle: RAG, OCR, STT profitieren von dedizierter GPU-Kapazität (typisch nützlich rund 48 GB, besser etwa 96 GB) – als eigene GPU oder MIG-Slices; im CPU-Modus funktionsfähig, aber langsamer.
  • Plattform: CPU, RAM, Speicher – keine GPU.

Ein Satz wie „basebox braucht zwei H200" beschreibt eine Inferenz-Entscheidung. Hintergrund: Architektur verstehen.

Getrennte Hosts

Die Hardware muss nicht in einer Maschine stecken: Ein reiner CPU-Anwendungsserver für die Plattform (und Service-Modelle im CPU-Modus) plus ein separater GPU-Host für die Inferenz ist ein unterstütztes Layout – siehe Deployment-Topologien. Das ist der Weg, wenn bereits ein GPU-System existiert oder die Inferenz in einer anderen Sicherheitszone liegen soll.

Beschaffungs-Checkliste

  • Zielmodell(e) und erwartete Parallelität bekannt → VRAM-Bedarf der Inferenz
  • Service-Modelle auf GPU (welche?) oder CPU-Modus entschieden
  • Konfiguration gegen die Referenzkonfigurationen geprüft; bei Custom Abstimmung mit basebox angestoßen
  • Arbeitsspeicher (128/512 GB bzw. eigener Wert), Speicher, Netzwerk dimensioniert
  • Strom, Kühlung, Rack-Platz freigegeben
  • Standort (Hosting-Optionen) und Betrieb (Betriebsmodelle) entschieden

Nächster Schritt: Hosting-Optionen