Licensed to be used in conjunction with basebox, only.
// installation
Architektur verstehen
Gilt für
Produkt: Cloud · Server · Zielgruppe: Platform Operator · Administrator · Sicherheitsprüfer
basebox ist nicht ein Workload. Es sind drei Schichten mit sehr unterschiedlichen Ressourcenprofilen. Fast jedes Sizing-Missverständnis – und jeder Satz wie „basebox braucht 2 × H200" – entsteht daraus, dass man sie in eins zusammenzieht.
flowchart TB
P["<b>basebox-Plattform</b><br/>Oberfläche · Apps · Authentifizierung · Berechtigungen<br/>Audit · APIs · Konnektoren · Orchestrierung<br/><i>wenig oder keine GPU</i>"]
S["<b>Service-Modelle</b><br/>Embeddings · RAG-Verarbeitung · OCR<br/>Sprache-zu-Text · TTS · Langzeitgedächtnis<br/><i>dedizierte GPU-Kapazität ideal</i>"]
I["<b>Inferenz</b><br/>das LLM / VLM / Reasoning-Modell<br/><i>Sizing hängt von Modell, Kontext, Parallelität ab</i>"]
P --> S --> I
style P fill:#f4f2ee,stroke:#524e47,color:#1d1e1c
style S fill:#dcefe2,stroke:#3a7a49,color:#1d1e1c
style I fill:#dbeafe,stroke:#1e40af,color:#1d1e1c
Schicht A – basebox-Plattform
Die Management- und Anwendungsschicht: Web-Oberfläche, Apps, Authentifizierung (Keycloak), Berechtigungen, Audit-Log, OpenAI-kompatible und REST-API, Konnektor-Orchestrierung (MCP-Gateway) sowie allgemeine Plattformdienste (Frontend, AISRV, storesrv, Datenbanken).
Ressourcenprofil: CPU, RAM, Speicher, Netzwerk. Die Plattform selbst benötigt keine großen GPU-Ressourcen. Sie kann auf einem reinen CPU-Anwendungsserver laufen – die Seite Deployment-Topologien zeigt genau dieses Layout.
Lesen oder schreiben Sie „basebox braucht GPU X" nie als Aussage über diese Schicht. Das ist technisch irreführend.
Schicht B – Service-Modelle
Zusätzliche KI-Modelle und -Dienste, auf die basebox-Funktionen angewiesen sind:
- Embeddings und RAG-Verarbeitung – Dokumente in durchsuchbare Vektoren wandeln und wiederfinden (
ragsrv,ragsrv-support) - OCR – Texterkennung für Scans, Fotos und reine Bilddokumente
- Sprache-zu-Text – Diktat und Audiotranskription
- TTS, Langzeitgedächtnis und weitere interne KI-Dienste, sobald sie hinzukommen
Ressourcenprofil: Diese Dienste profitieren von GPU-Beschleunigung und sollten als allgemeines Architekturprinzip dedizierte GPU-Kapazität haben, damit ein Upload oder eine Transkription nie mit der Inferenz um VRAM konkurriert. Typisch nützlich sind etwa 48 GB GPU-Speicher, besser rund 96 GB für größere Nutzungsszenarien – abhängig von der Nutzung des Kunden und den aktivierten Diensten.
Kein universelles Minimum
Die genannten Zahlen sind Architektur-Orientierung, keine unterstützte Mindestanforderung. Exakte unterstützte Werte stehen unter DevOps-Vorbehalt und werden erst nach Bestätigung auf den Seiten der Referenzkonfigurationen genannt.
Service-Modelle können im CPU-Modus laufen, wenn keine GPU verfügbar ist; RAG und OCR bleiben funktionsfähig, aber langsamer.
Schicht C – Inferenz
Die Schicht des LLM / VLM / Reasoning-Modells. Sie ist von basebox selbst getrennt: AISRV spricht sie über eine OpenAI-kompatible API an – egal, ob sie als gebündeltes vLLM auf demselben Knoten läuft, auf einem separaten GPU-Host, in einem anderen Cluster oder – wo freigegeben – bei einem externen Anbieter.
Ressourcenprofil: Hier gehören die großen GPUs hin, und das Sizing hängt ab von:
- gewähltem Modell und Modellgröße
- Quantisierung
- Kontextlänge
- erwarteter Parallelität
- geforderter Antwortlatenz
- Nutzungsmuster und Kunden-Workload
Das ist ein wirklich komplexes Sizing-Thema. Diese Dokumentation beantwortet nicht primär „Welche Hardware soll ich kaufen?" – dafür gibt es separates Sizing-Material. Sie beantwortet: Ich habe diese Infrastruktur – wie installiere und betreibe ich basebox darauf richtig?
Was das in der Praxis bedeutet
| Frage | Antwort |
|---|---|
| Kann basebox auf einem reinen CPU-Server laufen? | Die Plattform ja. Service-Modelle laufen im CPU-Modus (langsamer). Inferenz muss irgendwo auf einem GPU-Host liegen. |
| Warum listet eine Referenzkonfiguration zwei große GPUs? | Für Inferenz und Service-Modelle – nicht für basebox selbst. |
| Kann ich das Modell wechseln, ohne basebox anzufassen? | Ja. Inferenz ist eine eigene Schicht; Endpunkt oder Modell in der AISRV-Konfiguration ändern. |
| Wo dimensioniere ich? | Service-Modelle: Ressourcen & Skalierung. Inferenz: Modelle & Inferenz. Konkrete Setups: Referenzkonfigurationen. |
Vertiefung
- basebox-Plattform · Service-Modelle · Inferenz
- basebox-Komponenten – die einzelnen Dienste
- Deployment-Topologien – Plattform und Inferenz auf getrennten Hosts, mit ausgearbeitetem vLLM-Beispiel
Nächster Schritt: Deployment-Modelle