Licensed to be used in conjunction with basebox, only.
// installation
Hardware-Optionen
Gilt für
Produkt: Server · Zielgruppe: Platform Operator · Einkauf
Woher Server-Hardware kommt: FAST-LTA-/basebox-gelieferte Systeme oder vom Kunden beschaffte Hardware. FAST LTA ist Hardwarepartner, kein eigenes Produkt und kein eigenes Deployment-Modell – ein FAST-LTA-System ist ein basebox Server wie jeder andere.
Zwei Bezugswege
| Über FAST LTA beziehen | Selbst beschaffen | |
|---|---|---|
| Was Sie bekommen | Ein vorkonfiguriertes System, das basebox als Referenzkonfiguration führt | Eigene oder vorhandene Hardware |
| Status | Supported oder Validated je Konfiguration | Validated, wenn sie einer gelisteten Konfiguration entspricht; sonst Custom – Prüfung mit basebox |
| Arbeitsspeicher-Optionen | 128 GB oder 512 GB je System | Nach Ihrem Bedarf |
| Vorteil | Bekanntes Setup, dokumentierte GPU-Zuteilung, kurze Abstimmung | Nutzung vorhandener Investitionen, freie Wahl |
| Aufwand | Gering | Prüfung gegen Anforderungen; bei Custom individuelle Abstimmung |
Beide Wege führen zur selben Software und demselben Installationsablauf.
Aktuelle FAST-LTA-Konfigurationen
| Konfiguration | GPUs | Typische Aufteilung | Status |
|---|---|---|---|
| 3 × NVIDIA RTX PRO 6000 | 3 Workstation-Klasse | Dedizierte Service-GPU, übrige für Inferenz | Supported |
| 2 × NVIDIA H200 141 GB | 2 Rechenzentrums-Klasse | 1 Inferenz, 1 als 4 × MIG für Services; gemessener Referenz-Workload | Validated |
| 2 × NVIDIA H200 + 1 × RTX PRO 6000 | 2 + 1 | 2 Inferenz, RTX PRO 6000 dediziert für Services | Supported |
Jeweils mit 128 GB oder 512 GB Arbeitsspeicher; der Arbeitsspeicher ist eine Eigenschaft der Konfiguration, keine eigene Konfiguration. Bedeutung der Status: Status-Begriffe.
Selbst beschaffte Hardware
Entspricht sie einer Referenzkonfiguration, gilt deren Status – etwa 4 × NVIDIA H100 SXM 80 GB (Validated; gilt ausdrücklich für SXM, nicht für PCIe oder NVL).
Entspricht sie keiner, ist sie Custom: funktionsfähig möglicherweise, aber erst nach individueller Prüfung mit basebox unterstützt. Dokumentieren Sie das vereinbarte Setup mit der Vorlage Eigene Hardware.
Mindestens erfüllen muss die Hardware, was der Server Preparation Guide und das Chart verlangen:
| Komponente | Minimum | Empfehlung |
|---|---|---|
| GPU | NVIDIA, Compute Capability 7.0+ (V100, T4, RTX 20xx, A100, L4, H100 …); Treiber kompatibel mit CUDA 13.0 (12.9 als Rückfall) | Rechenzentrums-GPUs mit ausreichend VRAM für Modell und Service-Modelle; MIG-fähig, wenn Services per MIG laufen sollen |
| CPU | 8 Kerne | 16+ Kerne |
| Arbeitsspeicher | 16 GB | 32 GB+, 64 GB+ für große Modelle |
| Speicher | 500 GB | 1 TB+ SSD/NVMe für Modelle, Dokumente, Datenbanken |
| Netzwerk | Zugang zur Image-Registry während der Installation oder Offline-Transfer | Getrennte Netze für Nutzerzugang und Inferenz, wenn Hosts getrennt sind |
| Strom und Kühlung | Für die GPUs bei ihrer konfigurierten Leistungsgrenze | Vom Serverhersteller freigegeben |
Was die GPU-Frage wirklich entscheidet
Nicht basebox – sondern Inferenz und Service-Modelle:
- Inferenz: Modell, Quantisierung, Kontextlänge, Parallelität und Latenzziel bestimmen den VRAM. Orientierung: LLM-Empfehlungen – etwa GPT-OSS 120B MXFP4 auf 4 × H100 oder GPT-OSS 20B auf einer 24-GB-GPU.
- Service-Modelle: RAG, OCR, STT profitieren von dedizierter GPU-Kapazität (typisch nützlich rund 48 GB, besser etwa 96 GB) – als eigene GPU oder MIG-Slices; im CPU-Modus funktionsfähig, aber langsamer.
- Plattform: CPU, RAM, Speicher – keine GPU.
Ein Satz wie „basebox braucht zwei H200" beschreibt eine Inferenz-Entscheidung. Hintergrund: Architektur verstehen.
Getrennte Hosts
Die Hardware muss nicht in einer Maschine stecken: Ein reiner CPU-Anwendungsserver für die Plattform (und Service-Modelle im CPU-Modus) plus ein separater GPU-Host für die Inferenz ist ein unterstütztes Layout – siehe Deployment-Topologien. Das ist der Weg, wenn bereits ein GPU-System existiert oder die Inferenz in einer anderen Sicherheitszone liegen soll.
Beschaffungs-Checkliste
- Zielmodell(e) und erwartete Parallelität bekannt → VRAM-Bedarf der Inferenz
- Service-Modelle auf GPU (welche?) oder CPU-Modus entschieden
- Konfiguration gegen die Referenzkonfigurationen geprüft; bei Custom Abstimmung mit basebox angestoßen
- Arbeitsspeicher (128/512 GB bzw. eigener Wert), Speicher, Netzwerk dimensioniert
- Strom, Kühlung, Rack-Platz freigegeben
- Standort (Hosting-Optionen) und Betrieb (Betriebsmodelle) entschieden
Nächster Schritt: Hosting-Optionen