Zum Inhalt

// installation

Getestete Modelle

Gilt für

Produkt: Server · Zielgruppe: Platform Operator

Modelle, die basebox tatsächlich geprüft hat, mit Metadaten je Eintrag: zuletzt getestet, basebox-Version, Backend, Hardware, Quantisierung, Kontext. Diese Seite listet nur, was dokumentiert geprüft wurde – nicht, was funktionieren sollte (dafür: Unterstützte Inferenz-Backends) und nicht, was basebox empfiehlt (dafür: Empfohlene Modelle).

Geprüfte Kombinationen

Modell Quantisierung Backend Hardware Kontext basebox Zuletzt geprüft Quelle
openai/gpt-oss-20b MXFP4 vLLM 0.15.0, externer Endpunkt separater GPU-Host 32.768 1.7.1 2026 Deployment-Topologien
Sprachmodell der Referenzkonfiguration – vLLM 2 × H200 141 GB (1 GPU Inferenz) bis ca. 258.000 Tokens Eingabe im Test – Referenz-Workload dokumentiert 2 × H200
Llama 3.3 70B Q8_0 · Q6_K · Q4_K_M – nach VRAM des Kundenservers – – 2025-10-10 (Modellregister) Modellregister
OpenAI GPT-OSS 120B MXFP4 – nach VRAM des Kundenservers – – 2026-05-05 (Modellregister) Modellregister
OpenAI GPT-OSS 20B MXFP4 – nach VRAM des Kundenservers – – 2025-05-05 (Modellregister) Modellregister

Die Einträge aus dem Modellregister sind die von basebox ausgelieferten Modelle mit ihren Prüfdaten aus dem Compliance-Paket; die Registerangaben sind rechtlicher Natur (Herkunft, Lizenz, Modifikation) und keine Leistungsmessung.

Im Test beobachtet (Sizing-Referenz)

Die LLM-Empfehlungen enthalten Beobachtungen aus Tests auf den Hardware-Klassen, ohne dass basebox-Version und Datum je Zeile dokumentiert sind:

Beobachtung Hardware Quelle
Qwen2.5 72B Int8 zeigte schnellere Antwortzeiten als Llama 3.3 70B FP8 4 × H100 LLM-Empfehlungen
Qwen3 4B Instruct FP16: ~23 Tokens/s, praktisch maximaler Kontext ~30k 1 × 24-GB-GPU LLM-Empfehlungen
Llama 3.3 70B AWQ kann hohe Perplexität zeigen – Bekannte Probleme
GPT-OSS 120B mit Datenparallelismus erzeugt fehlerhafte Ausgabe; Tensor-Parallelismus nutzen – Bekannte Probleme
Qwen 3 32B: nur BNB-4bit mit vLLM; /no_think anhängen 4 × L40S LLM-Empfehlungen

Diese Zeilen sind Sizing-Erfahrung, keine Validierung im Sinne der Tabelle oben.

Was ein Eintrag braucht

Damit ein Modell hier erscheinen kann, dokumentiert basebox je Kombination:

  • Modell (HuggingFace-Bezeichner), Quantisierung
  • Backend und Version
  • Hardware (GPU-Modell, Anzahl, TP), Referenzkonfiguration
  • Kontextgröße und geprüfte Parallelität
  • basebox-Version, Datum
  • Geprüfte Funktionen: Chat, Streaming, langer Kontext, Tool Calling (Konnektoren), Reasoning
  • Bekannte Einschränkungen

Ihre eigenen Prüfungen können Sie im selben Format an basebox melden – Vorlage unter Andere Modelle nutzen. So wächst die Liste.

Wie Sie die Tabelle lesen

  • Geprüft heißt: in dieser Kombination hat basebox Funktion und Verhalten bestätigt. Andere Kombinationen desselben Modells (andere GPU, anderer Kontext) sind kompatibel, nicht geprüft.
  • Kontext ist der geprüfte Wert, nicht das Maximum des Modells.
  • Hardware ist die Testumgebung, keine Anforderung.
  • Fehlt eine Angabe, ist sie nicht dokumentiert – sie wird nicht geschätzt.

Nächster Schritt: Empfohlene Modelle