Licensed to be used in conjunction with basebox, only.
// installation
Getestete Modelle
Gilt für
Produkt: Server · Zielgruppe: Platform Operator
Modelle, die basebox tatsächlich geprüft hat, mit Metadaten je Eintrag: zuletzt getestet, basebox-Version, Backend, Hardware, Quantisierung, Kontext. Diese Seite listet nur, was dokumentiert geprüft wurde – nicht, was funktionieren sollte (dafür: Unterstützte Inferenz-Backends) und nicht, was basebox empfiehlt (dafür: Empfohlene Modelle).
Geprüfte Kombinationen
| Modell | Quantisierung | Backend | Hardware | Kontext | basebox | Zuletzt geprüft | Quelle |
|---|---|---|---|---|---|---|---|
openai/gpt-oss-20b |
MXFP4 | vLLM 0.15.0, externer Endpunkt | separater GPU-Host | 32.768 | 1.7.1 | 2026 | Deployment-Topologien |
| Sprachmodell der Referenzkonfiguration | – | vLLM | 2 × H200 141 GB (1 GPU Inferenz) | bis ca. 258.000 Tokens Eingabe im Test | – | Referenz-Workload dokumentiert | 2 × H200 |
| Llama 3.3 70B | Q8_0 · Q6_K · Q4_K_M | – | nach VRAM des Kundenservers | – | – | 2025-10-10 (Modellregister) | Modellregister |
| OpenAI GPT-OSS 120B | MXFP4 | – | nach VRAM des Kundenservers | – | – | 2026-05-05 (Modellregister) | Modellregister |
| OpenAI GPT-OSS 20B | MXFP4 | – | nach VRAM des Kundenservers | – | – | 2025-05-05 (Modellregister) | Modellregister |
Die Einträge aus dem Modellregister sind die von basebox ausgelieferten Modelle mit ihren Prüfdaten aus dem Compliance-Paket; die Registerangaben sind rechtlicher Natur (Herkunft, Lizenz, Modifikation) und keine Leistungsmessung.
Im Test beobachtet (Sizing-Referenz)
Die LLM-Empfehlungen enthalten Beobachtungen aus Tests auf den Hardware-Klassen, ohne dass basebox-Version und Datum je Zeile dokumentiert sind:
| Beobachtung | Hardware | Quelle |
|---|---|---|
| Qwen2.5 72B Int8 zeigte schnellere Antwortzeiten als Llama 3.3 70B FP8 | 4 × H100 | LLM-Empfehlungen |
| Qwen3 4B Instruct FP16: ~23 Tokens/s, praktisch maximaler Kontext ~30k | 1 × 24-GB-GPU | LLM-Empfehlungen |
| Llama 3.3 70B AWQ kann hohe Perplexität zeigen | – | Bekannte Probleme |
| GPT-OSS 120B mit Datenparallelismus erzeugt fehlerhafte Ausgabe; Tensor-Parallelismus nutzen | – | Bekannte Probleme |
Qwen 3 32B: nur BNB-4bit mit vLLM; /no_think anhängen |
4 × L40S | LLM-Empfehlungen |
Diese Zeilen sind Sizing-Erfahrung, keine Validierung im Sinne der Tabelle oben.
Was ein Eintrag braucht
Damit ein Modell hier erscheinen kann, dokumentiert basebox je Kombination:
- Modell (HuggingFace-Bezeichner), Quantisierung
- Backend und Version
- Hardware (GPU-Modell, Anzahl, TP), Referenzkonfiguration
- Kontextgröße und geprüfte Parallelität
- basebox-Version, Datum
- Geprüfte Funktionen: Chat, Streaming, langer Kontext, Tool Calling (Konnektoren), Reasoning
- Bekannte Einschränkungen
Ihre eigenen Prüfungen können Sie im selben Format an basebox melden – Vorlage unter Andere Modelle nutzen. So wächst die Liste.
Wie Sie die Tabelle lesen
- Geprüft heißt: in dieser Kombination hat basebox Funktion und Verhalten bestätigt. Andere Kombinationen desselben Modells (andere GPU, anderer Kontext) sind kompatibel, nicht geprüft.
- Kontext ist der geprüfte Wert, nicht das Maximum des Modells.
- Hardware ist die Testumgebung, keine Anforderung.
- Fehlt eine Angabe, ist sie nicht dokumentiert – sie wird nicht geschätzt.
Nächster Schritt: Empfohlene Modelle