Zum Inhalt

// installation

Empfohlene Modelle

Gilt für

Produkt: Server · Zielgruppe: Platform Operator

Was basebox für gängige Szenarien vorschlägt – getrennt von dem, was lediglich funktioniert. Empfehlungen ändern sich mit neuen Modellen und Runtimes; sie beruhen auf den Tests der LLM-Empfehlungen (Sizing-Referenz) und den Referenzkonfigurationen. Eine Empfehlung ist keine Garantie: Prüfen Sie das Modell auf Ihrer Hardware mit Ihrem Workload.

Schnellauswahl nach Hardware-Klasse

Ihre Situation Empfohlenes Modell Quantisierung Kontext Gleichzeitige Nutzer (Richtwert)
Enterprise – 4 × H100 (320 GB) GPT-OSS 120B MXFP4, TP=4 (128k) oder TP=2 (32–64k) 128k / 32–64k 15–20 / 8–12
Alternative Enterprise Llama 3.3 70B Instruct FP8 32k–65k 20–25 / 10–12
Professional – 4 × L40S (192 GB) GPT-OSS 120B AWQ, TP=4 32–64k 5–8
Alternative Professional Llama 3.3 70B Instruct FP8 32k–65k 10–12 / 5–6
Workstation – 2 × RTX 4090 (48 GB) GPT-OSS 20B MXFP4, TP=2 64k 2–3
Entry – 1 × 24-GB-GPU (L4 o. Ä.) GPT-OSS 20B MXFP4 32k 1
Schnellere Antwortzeiten Qwen2.5 72B Instruct Int8 32–65k 10–12
Minimale Hardware, Tests Qwen3 4B Instruct FP16 30k 1
Reasoning gefordert DeepSeek R1 Distill 8B / 70B AWQ / FP8 32k 1–2 / 10–12

Die 141-GB-Klasse der H200 (Referenzkonfigurationen 2 × H200) liegt zwischen Professional und Enterprise: Eine H200 trägt Llama 3.3 70B FP8 mit langem Kontext; zwei H200 mit TP=2 GPT-OSS 120B MXFP4. Die 96-GB-Klasse der RTX PRO 6000 (2 Karten = 192 GB) orientiert sich an der L40S-Zeile. Beides als Orientierung – Getestete Modelle sagt, was gemessen ist.

Warum GPT-OSS die Standardempfehlung ist

  • Mixture-of-Experts: 117B Gesamt- bei 5,1B aktiven Parametern (120B) bzw. 21B/3,6B (20B) – schnelle Inferenz für die Modellgröße.
  • Passt mit MXFP4 in ~60 GB (120B) bzw. ~16 GB (20B) und lässt Platz für Kontext.
  • Reasoning-fähig – Denkmodi in basebox nutzbar, sofern der Reasoning-Parser in vLLM konfiguriert ist.
  • Im Lieferumfang von basebox und im Modellregister geführt.

Voraussetzungen: vLLM 0.10.1+; Tensor-Parallelismus statt Datenparallelismus; TP muss die 64 Attention-Heads teilen (1, 2, 4, 8).

Empfehlungen nach Einsatzszenario

Szenario Empfehlung Begründung
RAG über große Dokumente Möglichst viel Kontext (65k+) vor Parallelität; GPT-OSS 120B TP=4 oder Llama 3.3 70B FP8 65k Mehr abgerufene Abschnitte je Frage verbessern die Antwortqualität
Viele gleichzeitige Nutzer, kurze Fragen Kontext auf 16–32k begrenzen; KV-Cache-Quantisierung aktivieren Kapazität an gleichzeitigen Nutzern verdoppelt sich etwa
Analysen, mehrschrittige Aufgaben Reasoning-Modell (GPT-OSS mit Reasoning-Parser, DeepSeek R1 Distill) Denkmodi liefern belastbarere Ergebnisse; kosten Zeit und Tokens
Konnektoren intensiv genutzt Modell mit zuverlässigem Tool Calling (GPT-OSS, Llama 3.3 70B) Der Assistent ruft Werkzeuge über Funktionsaufrufe auf
Mehrsprachig (DE/EN) Llama 3.3 70B, Qwen2.5 72B, GPT-OSS Solide deutsche Ausgabe; auf Ihrem Korpus prüfen
Zwei Modelle nebeneinander (Standard + Reasoning oder Standard + klein) Zwei Inferenz-Instanzen auf getrennten GPUs Siehe Mehrere Inferenz-Instanzen

Was nicht empfohlen wird

  • GGUF-Modelle in Produktion – in vLLM experimentell; native FP8/AWQ/GPTQ vorziehen.
  • Datenparallelismus für GPT-OSS 120B – erzeugt fehlerhafte Ausgabe.
  • Service-Modelle auf der Inferenz-GPU – Uploads und Transkriptionen konkurrieren dann mit dem Chat.
  • Kontext größer als die Runtime bedient – AISRV_LLM_CONTEXT_SIZE muss zum Runtime-Kontext passen.
  • Ein Modell nur nach Benchmark wählen – Qualität auf Ihrem Korpus, Sprache und Ton zählen; testen Sie mit echten (synthetischen) Aufgaben.

Bekannte Eigenheiten der empfohlenen Modelle

Modell Hinweis
GPT-OSS vLLM 0.10.1+; Reasoning-Parser konfigurieren; nur Tensor-Parallelismus
Llama 3.3 70B AWQ Kann hohe Perplexität zeigen; Repetition Penalty und Temperatur anpassen; FP8 vorziehen
DeepSeek-R1 Backend muss Thinking-Tokens filtern
Qwen 3 32B Nur BNB-4bit mit vLLM; /no_think anhängen, um Reasoning abzuschalten

Vollständig: LLM-Empfehlungen → Bekannte Probleme.

Empfehlung ≠ Prüfung

Diese Seite sagt, wo Sie anfangen sollten. Ob eine Kombination von basebox gemessen wurde, steht unter Getestete Modelle; Zahlen unter Benchmarks. Für Modelle außerhalb dieser Liste: Andere Modelle nutzen.

Nächster Schritt: Benchmarks