Licensed to be used in conjunction with basebox, only.
// installation
Empfohlene Modelle
Gilt für
Produkt: Server · Zielgruppe: Platform Operator
Was basebox für gängige Szenarien vorschlägt – getrennt von dem, was lediglich funktioniert. Empfehlungen ändern sich mit neuen Modellen und Runtimes; sie beruhen auf den Tests der LLM-Empfehlungen (Sizing-Referenz) und den Referenzkonfigurationen. Eine Empfehlung ist keine Garantie: Prüfen Sie das Modell auf Ihrer Hardware mit Ihrem Workload.
Schnellauswahl nach Hardware-Klasse
| Ihre Situation | Empfohlenes Modell | Quantisierung | Kontext | Gleichzeitige Nutzer (Richtwert) |
|---|---|---|---|---|
| Enterprise – 4 × H100 (320 GB) | GPT-OSS 120B | MXFP4, TP=4 (128k) oder TP=2 (32–64k) | 128k / 32–64k | 15–20 / 8–12 |
| Alternative Enterprise | Llama 3.3 70B Instruct | FP8 | 32k–65k | 20–25 / 10–12 |
| Professional – 4 × L40S (192 GB) | GPT-OSS 120B | AWQ, TP=4 | 32–64k | 5–8 |
| Alternative Professional | Llama 3.3 70B Instruct | FP8 | 32k–65k | 10–12 / 5–6 |
| Workstation – 2 × RTX 4090 (48 GB) | GPT-OSS 20B | MXFP4, TP=2 | 64k | 2–3 |
| Entry – 1 × 24-GB-GPU (L4 o. Ä.) | GPT-OSS 20B | MXFP4 | 32k | 1 |
| Schnellere Antwortzeiten | Qwen2.5 72B Instruct | Int8 | 32–65k | 10–12 |
| Minimale Hardware, Tests | Qwen3 4B Instruct | FP16 | 30k | 1 |
| Reasoning gefordert | DeepSeek R1 Distill 8B / 70B | AWQ / FP8 | 32k | 1–2 / 10–12 |
Die 141-GB-Klasse der H200 (Referenzkonfigurationen 2 × H200) liegt zwischen Professional und Enterprise: Eine H200 trägt Llama 3.3 70B FP8 mit langem Kontext; zwei H200 mit TP=2 GPT-OSS 120B MXFP4. Die 96-GB-Klasse der RTX PRO 6000 (2 Karten = 192 GB) orientiert sich an der L40S-Zeile. Beides als Orientierung – Getestete Modelle sagt, was gemessen ist.
Warum GPT-OSS die Standardempfehlung ist
- Mixture-of-Experts: 117B Gesamt- bei 5,1B aktiven Parametern (120B) bzw. 21B/3,6B (20B) – schnelle Inferenz für die Modellgröße.
- Passt mit MXFP4 in ~60 GB (120B) bzw. ~16 GB (20B) und lässt Platz für Kontext.
- Reasoning-fähig – Denkmodi in basebox nutzbar, sofern der Reasoning-Parser in vLLM konfiguriert ist.
- Im Lieferumfang von basebox und im Modellregister geführt.
Voraussetzungen: vLLM 0.10.1+; Tensor-Parallelismus statt Datenparallelismus; TP muss die 64 Attention-Heads teilen (1, 2, 4, 8).
Empfehlungen nach Einsatzszenario
| Szenario | Empfehlung | Begründung |
|---|---|---|
| RAG über große Dokumente | Möglichst viel Kontext (65k+) vor Parallelität; GPT-OSS 120B TP=4 oder Llama 3.3 70B FP8 65k | Mehr abgerufene Abschnitte je Frage verbessern die Antwortqualität |
| Viele gleichzeitige Nutzer, kurze Fragen | Kontext auf 16–32k begrenzen; KV-Cache-Quantisierung aktivieren | Kapazität an gleichzeitigen Nutzern verdoppelt sich etwa |
| Analysen, mehrschrittige Aufgaben | Reasoning-Modell (GPT-OSS mit Reasoning-Parser, DeepSeek R1 Distill) | Denkmodi liefern belastbarere Ergebnisse; kosten Zeit und Tokens |
| Konnektoren intensiv genutzt | Modell mit zuverlässigem Tool Calling (GPT-OSS, Llama 3.3 70B) | Der Assistent ruft Werkzeuge über Funktionsaufrufe auf |
| Mehrsprachig (DE/EN) | Llama 3.3 70B, Qwen2.5 72B, GPT-OSS | Solide deutsche Ausgabe; auf Ihrem Korpus prüfen |
| Zwei Modelle nebeneinander (Standard + Reasoning oder Standard + klein) | Zwei Inferenz-Instanzen auf getrennten GPUs | Siehe Mehrere Inferenz-Instanzen |
Was nicht empfohlen wird
- GGUF-Modelle in Produktion – in vLLM experimentell; native FP8/AWQ/GPTQ vorziehen.
- Datenparallelismus für GPT-OSS 120B – erzeugt fehlerhafte Ausgabe.
- Service-Modelle auf der Inferenz-GPU – Uploads und Transkriptionen konkurrieren dann mit dem Chat.
- Kontext größer als die Runtime bedient –
AISRV_LLM_CONTEXT_SIZEmuss zum Runtime-Kontext passen. - Ein Modell nur nach Benchmark wählen – Qualität auf Ihrem Korpus, Sprache und Ton zählen; testen Sie mit echten (synthetischen) Aufgaben.
Bekannte Eigenheiten der empfohlenen Modelle
| Modell | Hinweis |
|---|---|
| GPT-OSS | vLLM 0.10.1+; Reasoning-Parser konfigurieren; nur Tensor-Parallelismus |
| Llama 3.3 70B AWQ | Kann hohe Perplexität zeigen; Repetition Penalty und Temperatur anpassen; FP8 vorziehen |
| DeepSeek-R1 | Backend muss Thinking-Tokens filtern |
| Qwen 3 32B | Nur BNB-4bit mit vLLM; /no_think anhängen, um Reasoning abzuschalten |
Vollständig: LLM-Empfehlungen → Bekannte Probleme.
Empfehlung ≠ Prüfung
Diese Seite sagt, wo Sie anfangen sollten. Ob eine Kombination von basebox gemessen wurde, steht unter Getestete Modelle; Zahlen unter Benchmarks. Für Modelle außerhalb dieser Liste: Andere Modelle nutzen.
Nächster Schritt: Benchmarks