Zum Inhalt

// installation

Modelle konfigurieren

Gilt für

Produkt: Server · Zielgruppe: Platform Operator

Die AISRV-Einstellungen, die basebox an ein Modell binden – URL, Provider, Modellbezeichner, Kontextgröße, Ausgabelimits, Sampling-Standardwerte, Umgang mit API-Schlüsseln – und ihre Gegenstücke in der Inferenz-Runtime. Beide Seiten müssen zusammenpassen; die häufigsten Fehler sind ein abweichender Modellbezeichner und eine Kontextgröße, die die Runtime nicht bedient.

Die AISRV-Seite

Variable Bedeutung Beispiel
AISRV_LLM_URL Basis-URL des Endpunkts http://inference:8000 (gebündelt) · https://inference.customer.internal (extern)
AISRV_LLM_CHAT_ENDPOINT Pfad der Chat Completions /v1/chat/completions
AISRV_LLM_PROVIDER Bestimmt das Auth-Schema vLLM · openai-compatible
AISRV_LLM_MODEL Modellbezeichner – exakt wie unter /v1/models openai/gpt-oss-20b
AISRV_LLM_API_KEY API-Schlüssel des Endpunkts, aus Secret valueFrom.secretKeyRef
VLLM_API_KEY Providerspezifische Ableitung bei vLLM; dasselbe Secret valueFrom.secretKeyRef
AISRV_LLM_CONTEXT_SIZE Maximale Kontextgröße in Tokens; begrenzt, was ein Chat laden kann; wird unter „Über" angezeigt 32768
AISRV_LLM_MAX_TOKENS Maximale Ausgabe-Tokens (Standard 8000) 8000
AISRV_LLM_WORD_LIMIT Geschätztes Wortlimit je Anfrage 2000
AISRV_LLM_TEMPERATURE Sampling-Standard (0–1) 0.7
AISRV_LLM_TOP_P Nucleus-Sampling (0–1) –
AISRV_LLM_REPETITION_PENALTY > 1.0 hemmt Wiederholungen (relevant z. B. bei Llama 3.3 70B AWQ) –

Alle Werte stehen in aisrv.env der Helm-Values. Referenz: AISRV → LLM-Konfiguration.

Die Runtime-Seite (gebündeltes vLLM)

Variable Bedeutung Beispiel
MODEL_ID HuggingFace-Bezeichner des Modells; muss AISRV_LLM_MODEL entsprechen openai/gpt-oss-20b
MAX_INPUT_TOKENS Maximale Eingabelänge; ≥ AISRV_LLM_CONTEXT_SIZE 32000
NUM_GPUS Tensor-Parallelismus 1, 2, 4
SHM_SIZE Shared Memory für GPU-Operationen 32gb
API_KEY Zugangsberechtigung des Endpunkts; dasselbe Secret wie AISRV –
HF_TOKEN HuggingFace-Token für Downloads (Secret) –
HF_HOME, TRANSFORMERS_CACHE Cache-Pfade auf dem Modell-Volume /data/.cache/huggingface
HF_HUB_OFFLINE 1 im abgeschotteten Betrieb mit vorab geladenen Modellen –

Referenz und Beispiele (Produktion, Offline, kleines Modell, Multi-GPU): Inference Server. Bei einem externen Endpunkt konfigurieren Sie die Runtime dort; AISRV braucht nur URL, Provider, Modell, Kontext und Schlüssel.

Was zusammenpassen muss

AISRV Runtime Prüfung
AISRV_LLM_MODEL MODEL_ID bzw. /v1/models curl $AISRV_LLM_URL/v1/models aus dem AISRV-Pod
AISRV_LLM_CONTEXT_SIZE Kontext, den die Runtime tatsächlich bedient (MAX_INPUT_TOKENS, --max-model-len) Langen synthetischen Text zusammenfassen lassen
AISRV_LLM_API_KEY / VLLM_API_KEY API_KEY Kein 401
Tool Calling erwartet (Konnektoren) Modell und Runtime unterstützen Function Calling Konnektor im Chat aufrufen
Denkmodi erwartet Reasoning-Parser konfiguriert (z. B. für GPT-OSS) Reasoning-Bereich erscheint getrennt vom Antworttext

Kontextgröße richtig wählen

Der Kontext ist ein Zielkonflikt mit der Parallelität: KV-Cache = Kontext × gleichzeitige Nutzer × Cache je Token. Beispiel Llama 3.3 70B FP8 auf 4 × H100: 65k → 10–12 Nutzer, 32k → 20–25, 16k → 40–50. Für RAG-Workloads eher Kontext priorisieren (mehr Abschnitte pro Frage); KV-Cache-Quantisierung kann die Kapazität etwa verdoppeln. Tabellen: LLM-Empfehlungen → Kontextgröße vs. gleichzeitige Nutzer.

AISRV_LLM_CONTEXT_SIZE darf nicht größer sein als der Runtime-Kontext; sonst brechen lange Anfragen ab. Nutzer sehen den Wert unter „Über" und verstehen darüber das Kontextfenster.

Schlüssel und Secrets

Alle Schlüssel als Kubernetes-Secret, referenziert per valueFrom.secretKeyRef – nie im Klartext in Values, nie in Git. Rotation: neues Secret setzen, helm upgrade, alten Schlüssel in der Runtime widerrufen. Bei vLLM als Provider beide Variablen (AISRV_LLM_API_KEY, VLLM_API_KEY) auf dasselbe Secret.

Was Administratoren darüber hinaus einstellen

Auf Anwendungsebene, nicht in Values: Standardmodell der Organisation, Modell je App, Denkaufwand und Temperatur je App – siehe Modellkonfiguration (Administration). Ihre Runtime-Werte sind die Obergrenzen, innerhalb derer die Anwendung arbeitet.

Modell wechseln

  1. Neues Modell dimensionieren (LLM-Empfehlungen); GPU-Speicher und Cache-Volume prüfen.
  2. MODEL_ID (oder externen Endpunkt) und AISRV_LLM_MODEL, AISRV_LLM_CONTEXT_SIZE gemeinsam ändern.
  3. helm upgrade in einem Wartungsfenster; Modell-Download und Warm-up abwarten (Minuten).
  4. Prüfen wie unter Inferenz anbinden → Prüfen; Administratoren informieren, dass „Über" das neue Modell zeigt.
  5. Bekannte Eigenheiten des Modells beachten: Bekannte Probleme.

Nächster Schritt: Getestete Modelle