Zum Inhalt

// installation

Referenzkonfiguration: Eigene Hardware

Gilt für

Produkt: Server · Betrieb: durch den Kunden oder durch basebox · Zielgruppe: Platform Operator · Hardware: Eigene Hardware

Was eine Referenzkonfiguration ist

Eine Referenzkonfiguration dokumentiert ein konkretes, bekanntes Setup. Sie bedeutet nicht, dass basebox diese Hardware benötigt. Gemeinsame Installationsschritte werden hier nicht wiederholt – sie stehen im Bare-Metal-Installationsleitfaden.

Kundenspezifische Hardware, die keiner der gelisteten Konfigurationen entspricht. Sie erfordert eine individuelle Prüfung mit basebox, bevor sie als unterstützt gelten kann. Diese Seite ist zugleich Vorlage: Kopieren Sie sie, füllen Sie jeden Abschnitt für Ihr Setup und vergeben Sie den Status ehrlich – so entsteht die Dokumentation, mit der basebox Ihr System prüft und die Ihr Betrieb später braucht.

Status

Custom – siehe Status-Begriffe. Nach erfolgreicher Prüfung kann basebox das Setup als Experimental oder Supported einstufen.

Mindestvoraussetzungen

Unabhängig von der konkreten Hardware muss erfüllt sein:

Bereich Anforderung
GPU NVIDIA, Compute Capability 7.0+; Treiber kompatibel mit CUDA 13.0 (12.9 als Rückfall); MIG-fähig, wenn Service-Modelle per MIG laufen sollen
VRAM Genug für das Zielmodell (Gewichte + KV-Cache für Kontext × Parallelität) plus Kapazität für die Service-Modelle, die nicht die Inferenz-GPU teilen sollten
CPU / RAM 8 Kerne / 16 GB minimal; 16+ Kerne / 32–64 GB+ empfohlen
Speicher 500 GB minimal; 1 TB+ SSD/NVMe empfohlen; Storage Class mit dynamischer Bereitstellung
Betriebssystem Ubuntu 24.04 LTS empfohlen; 22.04 für bestehende Systeme; alternative Distributionen nur nach Test
Kubernetes 1.23+ (1.33+ geprüft), GPU Operator, Ingress-Controller, CloudNativePG
Netzwerk Registry-Zugang oder Offline-Transfer; DNS/TLS-Weg; Firewall zwischen AISRV und Inferenz, falls getrennt

Details: Voraussetzungen · Server Preparation Guide.

Ablauf der Prüfung mit basebox

  1. Hardware-Manifest festhalten: Servermodell, GPU-SKU und -Anzahl, VRAM, Firmware, CPU, RAM, Speicher, Netzwerk, NUMA-Layout, GPU-Topologie (nvidia-smi -L, nvidia-smi topo -m).
  2. Zielmodell und Workload benennen: Modell, Quantisierung, Kontext, erwartete Parallelität, Dokumentvolumen, Audio.
  3. Zuteilung vorschlagen: welche GPU(s) Inferenz, welche Service-Modelle (dediziert, MIG oder CPU-Modus).
  4. Installation nach dem Bare-Metal-Leitfaden; Abweichungen dokumentieren.
  5. Abnahmeprüfungen nach Installation prüfen durchführen – inklusive Mischlast und Neustart.
  6. Ergebnisse an basebox (support@basebox.ai) mit diesem ausgefüllten Dokument; basebox stuft den Status ein.

Vorlage – bitte ausfüllen

Architektur

Einzelner Knoten oder Cluster; welche Knoten tragen GPUs.

GPU

Physische GPU Modell VRAM Rolle (Inferenz / Service) UUID
GPU 0

Arbeitsspeicher

basebox-Version

Chart- und App-Version der geprüften Installation (helm list -n basebox).

Getestet am

Datum, Umgebung, verantwortliche Person.

Komponenten-Platzierung

Welche Komponenten auf welchem Knoten bzw. welcher GPU laufen.

Platzierung der Service-Modelle

GPU-/MIG-Zuteilung für GPU-RAG, Dokumentextraktion, OCR, Sprache-zu-Text – oder CPU-Modus.

Inferenz-Konfiguration

Backend und Version, Modell, Quantisierung, Kontextgröße, Tensor-Parallelismus, AISRV_LLM_*-Werte.

Getestete Modelle

Je Modell: Version, Quantisierung, Kontext, Parallelität, Ergebnis.

Abweichungen von der Standardinstallation

Helm-Values und Konfiguration, die vom Bare-Metal-Leitfaden abweichen.

Bekannte Einschränkungen

Verwandte Seiten