Zum Inhalt

// installation

Architektur verstehen

Gilt für

Produkt: Cloud · Server · Zielgruppe: Platform Operator · Administrator · Sicherheitsprüfer

basebox ist nicht ein Workload. Es sind drei Schichten mit sehr unterschiedlichen Ressourcenprofilen. Fast jedes Sizing-Missverständnis – und jeder Satz wie „basebox braucht 2 × H200" – entsteht daraus, dass man sie in eins zusammenzieht.

flowchart TB
  P["<b>basebox-Plattform</b><br/>Oberfläche · Apps · Authentifizierung · Berechtigungen<br/>Audit · APIs · Konnektoren · Orchestrierung<br/><i>wenig oder keine GPU</i>"]
  S["<b>Service-Modelle</b><br/>Embeddings · RAG-Verarbeitung · OCR<br/>Sprache-zu-Text · TTS · Langzeitgedächtnis<br/><i>dedizierte GPU-Kapazität ideal</i>"]
  I["<b>Inferenz</b><br/>das LLM / VLM / Reasoning-Modell<br/><i>Sizing hängt von Modell, Kontext, Parallelität ab</i>"]
  P --> S --> I
  style P fill:#f4f2ee,stroke:#524e47,color:#1d1e1c
  style S fill:#dcefe2,stroke:#3a7a49,color:#1d1e1c
  style I fill:#dbeafe,stroke:#1e40af,color:#1d1e1c

Schicht A – basebox-Plattform

Die Management- und Anwendungsschicht: Web-Oberfläche, Apps, Authentifizierung (Keycloak), Berechtigungen, Audit-Log, OpenAI-kompatible und REST-API, Konnektor-Orchestrierung (MCP-Gateway) sowie allgemeine Plattformdienste (Frontend, AISRV, storesrv, Datenbanken).

Ressourcenprofil: CPU, RAM, Speicher, Netzwerk. Die Plattform selbst benötigt keine großen GPU-Ressourcen. Sie kann auf einem reinen CPU-Anwendungsserver laufen – die Seite Deployment-Topologien zeigt genau dieses Layout.

Lesen oder schreiben Sie „basebox braucht GPU X" nie als Aussage über diese Schicht. Das ist technisch irreführend.

Schicht B – Service-Modelle

Zusätzliche KI-Modelle und -Dienste, auf die basebox-Funktionen angewiesen sind:

  • Embeddings und RAG-Verarbeitung – Dokumente in durchsuchbare Vektoren wandeln und wiederfinden (ragsrv, ragsrv-support)
  • OCR – Texterkennung für Scans, Fotos und reine Bilddokumente
  • Sprache-zu-Text – Diktat und Audiotranskription
  • TTS, Langzeitgedächtnis und weitere interne KI-Dienste, sobald sie hinzukommen

Ressourcenprofil: Diese Dienste profitieren von GPU-Beschleunigung und sollten als allgemeines Architekturprinzip dedizierte GPU-Kapazität haben, damit ein Upload oder eine Transkription nie mit der Inferenz um VRAM konkurriert. Typisch nützlich sind etwa 48 GB GPU-Speicher, besser rund 96 GB für größere Nutzungsszenarien – abhängig von der Nutzung des Kunden und den aktivierten Diensten.

Kein universelles Minimum

Die genannten Zahlen sind Architektur-Orientierung, keine unterstützte Mindestanforderung. Exakte unterstützte Werte stehen unter DevOps-Vorbehalt und werden erst nach Bestätigung auf den Seiten der Referenzkonfigurationen genannt.

Service-Modelle können im CPU-Modus laufen, wenn keine GPU verfügbar ist; RAG und OCR bleiben funktionsfähig, aber langsamer.

Schicht C – Inferenz

Die Schicht des LLM / VLM / Reasoning-Modells. Sie ist von basebox selbst getrennt: AISRV spricht sie über eine OpenAI-kompatible API an – egal, ob sie als gebündeltes vLLM auf demselben Knoten läuft, auf einem separaten GPU-Host, in einem anderen Cluster oder – wo freigegeben – bei einem externen Anbieter.

Ressourcenprofil: Hier gehören die großen GPUs hin, und das Sizing hängt ab von:

  • gewähltem Modell und Modellgröße
  • Quantisierung
  • Kontextlänge
  • erwarteter Parallelität
  • geforderter Antwortlatenz
  • Nutzungsmuster und Kunden-Workload

Das ist ein wirklich komplexes Sizing-Thema. Diese Dokumentation beantwortet nicht primär „Welche Hardware soll ich kaufen?" – dafür gibt es separates Sizing-Material. Sie beantwortet: Ich habe diese Infrastruktur – wie installiere und betreibe ich basebox darauf richtig?

Was das in der Praxis bedeutet

Frage Antwort
Kann basebox auf einem reinen CPU-Server laufen? Die Plattform ja. Service-Modelle laufen im CPU-Modus (langsamer). Inferenz muss irgendwo auf einem GPU-Host liegen.
Warum listet eine Referenzkonfiguration zwei große GPUs? Für Inferenz und Service-Modelle – nicht für basebox selbst.
Kann ich das Modell wechseln, ohne basebox anzufassen? Ja. Inferenz ist eine eigene Schicht; Endpunkt oder Modell in der AISRV-Konfiguration ändern.
Wo dimensioniere ich? Service-Modelle: Ressourcen & Skalierung. Inferenz: Modelle & Inferenz. Konkrete Setups: Referenzkonfigurationen.

Vertiefung

Nächster Schritt: Deployment-Modelle