Licensed to be used in conjunction with basebox, only.
// installation
Modelle & Inferenz
Gilt für
Produkt: Server · Zielgruppe: Platform Operator
Die Inferenzschicht ist von basebox selbst getrennt: AISRV spricht das Sprachmodell über eine OpenAI-kompatible API an – egal, wo es läuft. Dieser Abschnitt hält vier Dinge auseinander, die leicht verwechselt werden:
| Begriff | Bedeutung | Seite |
|---|---|---|
| Kompatibel | Was technisch laufen kann: jede Runtime, die die OpenAI-kompatible API in der von basebox genutzten Form implementiert | Unterstützte Inferenz-Backends |
| Getestet | Was basebox tatsächlich geprüft hat – mit Version, Backend, Hardware, Datum | Getestete Modelle |
| Empfohlen | Was basebox für gängige Szenarien vorschlägt – ändert sich mit neuen Modellen | Empfohlene Modelle |
| Gemessen | Zahlen von Referenzkonfigurationen: Durchsatz, Latenz, langer Kontext | Benchmarks |
Ein kompatibles Modell ist nicht automatisch getestet; ein getestetes nicht automatisch empfohlen. Die Seiten sagen jeweils, was sie sind.
In diesem Abschnitt
- Inferenz-Architektur – wo Inferenz läuft, wie AISRV mit ihr spricht, wo die Datengrenze liegt
- Unterstützte Inferenz-Backends – vLLM als validiertes Backend, was jeder Endpunkt erfüllen muss, externe Anbieter
- Modelle konfigurieren – die
AISRV_LLM_*-Einstellungen und ihre Gegenstücke in der Inferenz-Runtime - Getestete Modelle
- Empfohlene Modelle
- Benchmarks
- Andere Modelle nutzen – ein Modell außerhalb der Listen prüfen, validieren und melden
- LLM-Empfehlungen (Sizing-Referenz) – welches Modell auf welche GPU passt
Das Wichtigste in drei Sätzen
Die GPU-Frage ist eine Inferenz-Frage. Modell, Quantisierung, Kontextlänge und Parallelität bestimmen den VRAM – nicht basebox. Die Plattform selbst braucht keine GPU; die Service-Modelle (RAG, OCR, STT) brauchen eigene, vorhersehbare Kapazität, die nicht mit der Inferenz geteilt werden sollte.
Der Modellbezeichner muss stimmen. AISRV_LLM_MODEL muss exakt dem entsprechen, was der Endpunkt unter /v1/models meldet; sonst „Model not found".
Kein stiller Rückfall. Ist der Endpunkt offline, zeigt basebox den Fehler an und erholt sich, sobald er wieder bereit ist. Es wechselt nicht unbemerkt auf ein anderes Modell – planen Sie Monitoring entsprechend.
Wer entscheidet was
| Entscheidung | Wer |
|---|---|
| Welche Modelle technisch angebunden sind | Platform Operator (diese Seiten) |
| Welches Modell die Organisation standardmäßig nutzt, welches je App | Administrator – Modellauswahl · Modelle aktivieren |
| Reasoning-Aufwand je Chat | Nutzer – Reasoning-Aufwand |
| Ob externe Modellanbieter (OpenAI, Anthropic) in Frage kommen | Organisation, vertraglich und datenschutzrechtlich – Modellanbieter |
Rechtlicher Rahmen
Die von basebox ausgelieferten Modelle stehen im Modellregister des Compliance-Pakets nach EU AI Act; basebox verändert Modelle nur durch Quantisierung. Wer ein Modell nachtrainiert oder feinabstimmt, übernimmt die Rolle des Providers – siehe Haftungsausschluss. Closed-Source-Modelle sind nicht Teil der Lieferung.
Nächster Schritt: Inferenz-Architektur