Zum Inhalt

// installation

Modelle & Inferenz

Gilt für

Produkt: Server · Zielgruppe: Platform Operator

Die Inferenzschicht ist von basebox selbst getrennt: AISRV spricht das Sprachmodell über eine OpenAI-kompatible API an – egal, wo es läuft. Dieser Abschnitt hält vier Dinge auseinander, die leicht verwechselt werden:

Begriff Bedeutung Seite
Kompatibel Was technisch laufen kann: jede Runtime, die die OpenAI-kompatible API in der von basebox genutzten Form implementiert Unterstützte Inferenz-Backends
Getestet Was basebox tatsächlich geprüft hat – mit Version, Backend, Hardware, Datum Getestete Modelle
Empfohlen Was basebox für gängige Szenarien vorschlägt – ändert sich mit neuen Modellen Empfohlene Modelle
Gemessen Zahlen von Referenzkonfigurationen: Durchsatz, Latenz, langer Kontext Benchmarks

Ein kompatibles Modell ist nicht automatisch getestet; ein getestetes nicht automatisch empfohlen. Die Seiten sagen jeweils, was sie sind.

In diesem Abschnitt

  1. Inferenz-Architektur – wo Inferenz läuft, wie AISRV mit ihr spricht, wo die Datengrenze liegt
  2. Unterstützte Inferenz-Backends – vLLM als validiertes Backend, was jeder Endpunkt erfüllen muss, externe Anbieter
  3. Modelle konfigurieren – die AISRV_LLM_*-Einstellungen und ihre Gegenstücke in der Inferenz-Runtime
  4. Getestete Modelle
  5. Empfohlene Modelle
  6. Benchmarks
  7. Andere Modelle nutzen – ein Modell außerhalb der Listen prüfen, validieren und melden
  8. LLM-Empfehlungen (Sizing-Referenz) – welches Modell auf welche GPU passt

Das Wichtigste in drei Sätzen

Die GPU-Frage ist eine Inferenz-Frage. Modell, Quantisierung, Kontextlänge und Parallelität bestimmen den VRAM – nicht basebox. Die Plattform selbst braucht keine GPU; die Service-Modelle (RAG, OCR, STT) brauchen eigene, vorhersehbare Kapazität, die nicht mit der Inferenz geteilt werden sollte.

Der Modellbezeichner muss stimmen. AISRV_LLM_MODEL muss exakt dem entsprechen, was der Endpunkt unter /v1/models meldet; sonst „Model not found".

Kein stiller Rückfall. Ist der Endpunkt offline, zeigt basebox den Fehler an und erholt sich, sobald er wieder bereit ist. Es wechselt nicht unbemerkt auf ein anderes Modell – planen Sie Monitoring entsprechend.

Wer entscheidet was

Entscheidung Wer
Welche Modelle technisch angebunden sind Platform Operator (diese Seiten)
Welches Modell die Organisation standardmäßig nutzt, welches je App Administrator – Modellauswahl · Modelle aktivieren
Reasoning-Aufwand je Chat Nutzer – Reasoning-Aufwand
Ob externe Modellanbieter (OpenAI, Anthropic) in Frage kommen Organisation, vertraglich und datenschutzrechtlich – Modellanbieter

Rechtlicher Rahmen

Die von basebox ausgelieferten Modelle stehen im Modellregister des Compliance-Pakets nach EU AI Act; basebox verändert Modelle nur durch Quantisierung. Wer ein Modell nachtrainiert oder feinabstimmt, übernimmt die Rolle des Providers – siehe Haftungsausschluss. Closed-Source-Modelle sind nicht Teil der Lieferung.

Nächster Schritt: Inferenz-Architektur