Licensed to be used in conjunction with basebox, only.
// installation
Modelle konfigurieren
Gilt für
Produkt: Server · Zielgruppe: Platform Operator
Die AISRV-Einstellungen, die basebox an ein Modell binden – URL, Provider, Modellbezeichner, Kontextgröße, Ausgabelimits, Sampling-Standardwerte, Umgang mit API-Schlüsseln – und ihre Gegenstücke in der Inferenz-Runtime. Beide Seiten müssen zusammenpassen; die häufigsten Fehler sind ein abweichender Modellbezeichner und eine Kontextgröße, die die Runtime nicht bedient.
Die AISRV-Seite
| Variable | Bedeutung | Beispiel |
|---|---|---|
AISRV_LLM_URL |
Basis-URL des Endpunkts | http://inference:8000 (gebündelt) · https://inference.customer.internal (extern) |
AISRV_LLM_CHAT_ENDPOINT |
Pfad der Chat Completions | /v1/chat/completions |
AISRV_LLM_PROVIDER |
Bestimmt das Auth-Schema | vLLM · openai-compatible |
AISRV_LLM_MODEL |
Modellbezeichner – exakt wie unter /v1/models |
openai/gpt-oss-20b |
AISRV_LLM_API_KEY |
API-Schlüssel des Endpunkts, aus Secret | valueFrom.secretKeyRef |
VLLM_API_KEY |
Providerspezifische Ableitung bei vLLM; dasselbe Secret |
valueFrom.secretKeyRef |
AISRV_LLM_CONTEXT_SIZE |
Maximale Kontextgröße in Tokens; begrenzt, was ein Chat laden kann; wird unter „Über" angezeigt | 32768 |
AISRV_LLM_MAX_TOKENS |
Maximale Ausgabe-Tokens (Standard 8000) | 8000 |
AISRV_LLM_WORD_LIMIT |
Geschätztes Wortlimit je Anfrage | 2000 |
AISRV_LLM_TEMPERATURE |
Sampling-Standard (0–1) | 0.7 |
AISRV_LLM_TOP_P |
Nucleus-Sampling (0–1) | – |
AISRV_LLM_REPETITION_PENALTY |
> 1.0 hemmt Wiederholungen (relevant z. B. bei Llama 3.3 70B AWQ) | – |
Alle Werte stehen in aisrv.env der Helm-Values. Referenz: AISRV → LLM-Konfiguration.
Die Runtime-Seite (gebündeltes vLLM)
| Variable | Bedeutung | Beispiel |
|---|---|---|
MODEL_ID |
HuggingFace-Bezeichner des Modells; muss AISRV_LLM_MODEL entsprechen |
openai/gpt-oss-20b |
MAX_INPUT_TOKENS |
Maximale Eingabelänge; ≥ AISRV_LLM_CONTEXT_SIZE |
32000 |
NUM_GPUS |
Tensor-Parallelismus | 1, 2, 4 |
SHM_SIZE |
Shared Memory für GPU-Operationen | 32gb |
API_KEY |
Zugangsberechtigung des Endpunkts; dasselbe Secret wie AISRV | – |
HF_TOKEN |
HuggingFace-Token für Downloads (Secret) | – |
HF_HOME, TRANSFORMERS_CACHE |
Cache-Pfade auf dem Modell-Volume | /data/.cache/huggingface |
HF_HUB_OFFLINE |
1 im abgeschotteten Betrieb mit vorab geladenen Modellen |
– |
Referenz und Beispiele (Produktion, Offline, kleines Modell, Multi-GPU): Inference Server. Bei einem externen Endpunkt konfigurieren Sie die Runtime dort; AISRV braucht nur URL, Provider, Modell, Kontext und Schlüssel.
Was zusammenpassen muss
| AISRV | Runtime | Prüfung |
|---|---|---|
AISRV_LLM_MODEL |
MODEL_ID bzw. /v1/models |
curl $AISRV_LLM_URL/v1/models aus dem AISRV-Pod |
AISRV_LLM_CONTEXT_SIZE |
Kontext, den die Runtime tatsächlich bedient (MAX_INPUT_TOKENS, --max-model-len) |
Langen synthetischen Text zusammenfassen lassen |
AISRV_LLM_API_KEY / VLLM_API_KEY |
API_KEY |
Kein 401 |
| Tool Calling erwartet (Konnektoren) | Modell und Runtime unterstützen Function Calling | Konnektor im Chat aufrufen |
| Denkmodi erwartet | Reasoning-Parser konfiguriert (z. B. für GPT-OSS) | Reasoning-Bereich erscheint getrennt vom Antworttext |
Kontextgröße richtig wählen
Der Kontext ist ein Zielkonflikt mit der Parallelität: KV-Cache = Kontext × gleichzeitige Nutzer × Cache je Token. Beispiel Llama 3.3 70B FP8 auf 4 × H100: 65k → 10–12 Nutzer, 32k → 20–25, 16k → 40–50. Für RAG-Workloads eher Kontext priorisieren (mehr Abschnitte pro Frage); KV-Cache-Quantisierung kann die Kapazität etwa verdoppeln. Tabellen: LLM-Empfehlungen → Kontextgröße vs. gleichzeitige Nutzer.
AISRV_LLM_CONTEXT_SIZE darf nicht größer sein als der Runtime-Kontext; sonst brechen lange Anfragen ab. Nutzer sehen den Wert unter „Über" und verstehen darüber das Kontextfenster.
Schlüssel und Secrets
Alle Schlüssel als Kubernetes-Secret, referenziert per valueFrom.secretKeyRef – nie im Klartext in Values, nie in Git. Rotation: neues Secret setzen, helm upgrade, alten Schlüssel in der Runtime widerrufen. Bei vLLM als Provider beide Variablen (AISRV_LLM_API_KEY, VLLM_API_KEY) auf dasselbe Secret.
Was Administratoren darüber hinaus einstellen
Auf Anwendungsebene, nicht in Values: Standardmodell der Organisation, Modell je App, Denkaufwand und Temperatur je App – siehe Modellkonfiguration (Administration). Ihre Runtime-Werte sind die Obergrenzen, innerhalb derer die Anwendung arbeitet.
Modell wechseln
- Neues Modell dimensionieren (LLM-Empfehlungen); GPU-Speicher und Cache-Volume prüfen.
MODEL_ID(oder externen Endpunkt) undAISRV_LLM_MODEL,AISRV_LLM_CONTEXT_SIZEgemeinsam ändern.helm upgradein einem Wartungsfenster; Modell-Download und Warm-up abwarten (Minuten).- Prüfen wie unter Inferenz anbinden → Prüfen; Administratoren informieren, dass „Über" das neue Modell zeigt.
- Bekannte Eigenheiten des Modells beachten: Bekannte Probleme.
Nächster Schritt: Getestete Modelle