Zum Inhalt

// installation

Service-Modelle

Gilt für

Produkt: Server · Zielgruppe: Platform Operator

Service-Modelle sind die KI-Dienste, auf die basebox-Funktionen neben dem Sprachmodell angewiesen sind. Sie bilden die mittlere Schicht: schwerer als die Plattform, leichter und weit besser vorhersehbar als die Inferenz.

Welche Dienste

Dienst Genutzt von Komponente
Embeddings Wissensbasen, RAG-Suche ragsrv
RAG-Verarbeitung Dokumentaufnahme, Chunking, Retrieval ragsrv, ragsrv-support
Dokumentextraktion Lesen von PDF, Office, E-Mail, Bildern ragsrv-support
OCR Scans, Fotos, reine Bilddokumente ragsrv-support
Sprache-zu-Text Diktat, Audiotranskription ragsrv-support
TTS, Langzeitgedächtnis, weitere Sobald Funktionen hinzukommen —

Ressourcenprofil

Als allgemeines Architekturprinzip sollten basebox-Plattform + Service-Modelle dedizierte GPU-Kapazität haben, getrennt von der Inferenz. Gründe:

  • Ein Upload, ein OCR-Auftrag oder eine einstündige Transkription kommen stoßweise. Auf einer geteilten GPU konkurrieren sie mit der Inferenz um VRAM und Rechenleistung, und Nutzer sehen Latenzspitzen im Chat.
  • Service-Modelle haben einen stabilen, vorhersehbaren Fußabdruck; die Inferenz nicht. Die Trennung macht das Sizing handhabbar.

Typisch nützliche Kapazität: etwa 48 GB GPU-Speicher, besser rund 96 GB für größere Nutzungsszenarien. Das hängt davon ab, welche Dienste aktiviert sind und wie intensiv Dokumente und Audio verarbeitet werden.

Architektur-Orientierung, keine Mindestanforderung

Lesen Sie diese Zahlen nicht als unterstütztes Minimum. Exakte Werte stehen unter DevOps-Vorbehalt und erscheinen erst nach Bestätigung auf den Seiten der Referenzkonfigurationen.

Dedizierte GPU vs. MIG vs. CPU-Modus

Drei Wege, Service-Modellen ihre Kapazität zu geben:

  1. Eine dedizierte physische GPU – z. B. die RTX PRO 6000 in der Konfiguration 2 × H200 + RTX PRO 6000. Siehe Dedizierte Service-GPU.
  2. MIG-Slices einer großen GPU – z. B. eine H200, aufgeteilt in vier 1g.35gb-Instanzen, eine je Dienst. Das ist das validierte Layout der Referenzkonfiguration 2 × H200.
  3. CPU-Modus – ragsrv und ragsrv-support laufen ohne GPU. Funktionsfähig für RAG und OCR, deutlich langsamer; geeignet für einen reinen CPU-Anwendungsserver, dessen Inferenz woanders liegt. Siehe Deployment-Topologien.

Platzierung

Service-Modelle können auf demselben Knoten wie die Inferenz sitzen (typischer Einzelknoten-Server) oder auf dem Anwendungsserver, wenn die Inferenz auf einem separaten GPU-Host läuft. In beiden Fällen sollten sie nicht den Speicher der Inferenz-GPU teilen.

Nächster Schritt: Inferenz