Zum Inhalt

// installation

Andere Modelle nutzen

Gilt für

Produkt: Server · Zielgruppe: Platform Operator

Ein Modell betreiben, das nicht auf der Testliste steht: was zu prüfen ist (API-Kompatibilität, Kontext, Tool Calling, Reasoning, Quantisierung, Lizenz), wie Sie es validieren und wie Sie das Ergebnis an basebox melden, damit aus Experimental gegebenenfalls Supported wird. Technisch kann jedes Modell laufen, das die Inferenz-Runtime bedient; ob es zu basebox passt, entscheidet die Checkliste.

1. Vorab prüfen

Prüfpunkt Frage Wo nachsehen
Runtime-Unterstützung Unterstützt vLLM (oder Ihr Backend) die Architektur und das Quantisierungsformat? vLLM-Dokumentation „Supported Models"
Quantisierung Natives Format (FP8, AWQ, GPTQ, MXFP4)? GGUF ist in vLLM experimentell – nicht für Produktion Modellkarte
VRAM Gewichte + KV-Cache für Kontext × Parallelität passen auf die Inferenz-GPU(s)? LLM-Empfehlungen → VRAM-Bedarf
Tensor-Parallelismus TP teilt die Attention-Heads? (GPT-OSS 120B: 1, 2, 4, 8) Modellkonfiguration (num_attention_heads)
Chat-Template Liefert das Modell ein Chat-Template für system/user/assistant/tool? Modellkarte, tokenizer_config.json
Tool Calling Unterstützt das Modell Function Calling zuverlässig? Sonst funktionieren Konnektoren nicht Modellkarte; vLLM-Tool-Parser
Reasoning Reasoning-Modell? Dann Reasoning-Parser in vLLM konfigurieren, sonst landet der Gedankengang im Text vLLM-Dokumentation „Reasoning Outputs"
Kontext Maximaler Kontext des Modells ≥ gewünschte AISRV_LLM_CONTEXT_SIZE? Modellkarte (max_position_embeddings)
Sprache Deutsch in ausreichender Qualität? Eigener Test mit synthetischen Aufgaben
Lizenz Kommerzielle Nutzung erlaubt? Bedingungen (Attribution, Nutzerzahl)? Modelllizenz

2. Rechtlich einordnen

  • basebox liefert nur Modelle aus, die der ursprüngliche Entwickler veröffentlicht und lizenziert hat, und verändert sie nur durch Quantisierung (Modellregister).
  • Binden Sie ein weiteres Modell an, sind Sie für Lizenz, Datenschutz und Einsatzkontext verantwortlich (Haftungsausschluss).
  • Feinabstimmung oder Nachtraining durch Sie macht Sie zum Provider im Sinne des EU AI Act – mit den entsprechenden Pflichten.
  • Externe Anbieter (OpenAI, Anthropic): Prompts und Kontext verlassen Ihre Umgebung; Datenschutz und Vertrag vorab klären – Modellanbieter.

3. Anbinden, ohne die Produktion zu stören

  • Als zweite Inferenz-Instanz auf einer freien GPU oder als externer Endpunkt – siehe Mehrere Inferenz-Instanzen und Inferenz anbinden, Variante B.
  • Konfiguration wie unter Modelle konfigurieren; Modellbezeichner exakt aus /v1/models.
  • Administratoren weisen das Modell zunächst nur einer privaten Test-App zu (Erweiterte Felder → Modell), nicht als Standardmodell.

4. Validieren

Mit synthetischen Testdaten, festgehalten als Metadaten:

Prüfung Bestanden, wenn
GET /v1/models aus dem AISRV-Pod Modellbezeichner erscheint
Chat, kurze Fragen (DE und EN) Antworten korrekt, Stil brauchbar, Streaming flüssig
Langer Kontext nahe AISRV_LLM_CONTEXT_SIZE Keine Abbrüche, Inhalt wird berücksichtigt
RAG-App mit Wissensbasis Antwort nutzt die abgerufenen Abschnitte und zitiert
Konnektor-Aufruf (z. B. Rechner) Modell ruft das Werkzeug korrekt auf, Ergebnis fließt in die Antwort
Reasoning (falls Modell) Gedankengang erscheint im Reasoning-Bereich, nicht im Antworttext
Parallelität Bei 4–8 gleichzeitigen Anfragen stabile Latenz, keine OOM-Fehler
Fehlerverhalten Endpunkt stoppen: Fehler sichtbar, kein Rückfall; nach Start Erholung
Neustart Modell lädt nach Reboot ohne Eingriff (Cache-Volume)

Achten Sie auf typische Eigenheiten: fehlende Stop-Tokens (endlose Ausgabe), Wiederholungen (Repetition Penalty), Thinking-Tokens im Text, falsche Sprache.

5. Status vergeben und melden

Nach bestandener Validierung ist das Modell für Sie Experimental – funktioniert, aber nicht von basebox produktiv validiert. Melden Sie das Ergebnis an support@basebox.ai im Format von Getestete Modelle:

Modell:             <HuggingFace-Bezeichner>
Quantisierung:      <FP8 / AWQ / MXFP4 / …>
Backend:            <vLLM x.y.z>
Hardware:           <GPU-Modell × Anzahl, TP>
Kontext:            <geprüfte AISRV_LLM_CONTEXT_SIZE>
Parallelität:       <geprüfte gleichzeitige Anfragen>
basebox:            <Chart / App-Version>
Datum:              <YYYY-MM-DD>
Geprüfte Funktionen: Chat · Streaming · langer Kontext · Tool Calling · Reasoning · RAG
Einschränkungen:    <…>

basebox kann das Modell nach eigener Prüfung als Supported führen.

6. In Produktion nehmen

Erst dann als Standardmodell oder in breit freigegebenen Apps – über die Modellauswahl der Administratoren. Monitoring auf Latenz und GPU-Speicher in den ersten Tagen; Nutzer über den Wechsel informieren (die Seite „Über" zeigt das aktive Modell).

Zurück: Modelle & Inferenz