Licensed to be used in conjunction with basebox, only.
// installation
Service-Modelle
Gilt für
Produkt: Server · Zielgruppe: Platform Operator
Service-Modelle sind die KI-Dienste, auf die basebox-Funktionen neben dem Sprachmodell angewiesen sind. Sie bilden die mittlere Schicht: schwerer als die Plattform, leichter und weit besser vorhersehbar als die Inferenz.
Welche Dienste
| Dienst | Genutzt von | Komponente |
|---|---|---|
| Embeddings | Wissensbasen, RAG-Suche | ragsrv |
| RAG-Verarbeitung | Dokumentaufnahme, Chunking, Retrieval | ragsrv, ragsrv-support |
| Dokumentextraktion | Lesen von PDF, Office, E-Mail, Bildern | ragsrv-support |
| OCR | Scans, Fotos, reine Bilddokumente | ragsrv-support |
| Sprache-zu-Text | Diktat, Audiotranskription | ragsrv-support |
| TTS, Langzeitgedächtnis, weitere | Sobald Funktionen hinzukommen | — |
Ressourcenprofil
Als allgemeines Architekturprinzip sollten basebox-Plattform + Service-Modelle dedizierte GPU-Kapazität haben, getrennt von der Inferenz. Gründe:
- Ein Upload, ein OCR-Auftrag oder eine einstündige Transkription kommen stoßweise. Auf einer geteilten GPU konkurrieren sie mit der Inferenz um VRAM und Rechenleistung, und Nutzer sehen Latenzspitzen im Chat.
- Service-Modelle haben einen stabilen, vorhersehbaren Fußabdruck; die Inferenz nicht. Die Trennung macht das Sizing handhabbar.
Typisch nützliche Kapazität: etwa 48 GB GPU-Speicher, besser rund 96 GB für größere Nutzungsszenarien. Das hängt davon ab, welche Dienste aktiviert sind und wie intensiv Dokumente und Audio verarbeitet werden.
Architektur-Orientierung, keine Mindestanforderung
Lesen Sie diese Zahlen nicht als unterstütztes Minimum. Exakte Werte stehen unter DevOps-Vorbehalt und erscheinen erst nach Bestätigung auf den Seiten der Referenzkonfigurationen.
Dedizierte GPU vs. MIG vs. CPU-Modus
Drei Wege, Service-Modellen ihre Kapazität zu geben:
- Eine dedizierte physische GPU – z. B. die RTX PRO 6000 in der Konfiguration 2 × H200 + RTX PRO 6000. Siehe Dedizierte Service-GPU.
- MIG-Slices einer großen GPU – z. B. eine H200, aufgeteilt in vier
1g.35gb-Instanzen, eine je Dienst. Das ist das validierte Layout der Referenzkonfiguration 2 × H200. - CPU-Modus –
ragsrvundragsrv-supportlaufen ohne GPU. Funktionsfähig für RAG und OCR, deutlich langsamer; geeignet für einen reinen CPU-Anwendungsserver, dessen Inferenz woanders liegt. Siehe Deployment-Topologien.
Platzierung
Service-Modelle können auf demselben Knoten wie die Inferenz sitzen (typischer Einzelknoten-Server) oder auf dem Anwendungsserver, wenn die Inferenz auf einem separaten GPU-Host läuft. In beiden Fällen sollten sie nicht den Speicher der Inferenz-GPU teilen.
Nächster Schritt: Inferenz