Zum Inhalt

// admin

Modellkonfiguration

Kurzbeschreibung

Einstellungen rund um ein Modell aus Sicht der Anwendung: Kontextgröße, Ausgabelimits, Temperatur, Reasoning-Standard. Die Anbindung der Inferenz selbst – URL, Modellbezeichner, Zugangsdaten – ist Aufgabe des Platform Operators; hier geht es um das, was Sie als Administrator und App-Ersteller beeinflussen und was Sie über die Konfiguration wissen sollten.

Wofür nutze ich das

Dasselbe Modell verhält sich je nach Konfiguration unterschiedlich: knapp oder ausführlich, nüchtern oder kreativ, schnell oder gründlich. Über die Konfiguration passen Sie es an den Zweck einer App an – und begrenzen Verbrauch.

Zwei Ebenen der Konfiguration

Ebene Wer Was
Inferenz-Anbindung (Server) Platform Operator, per Helm-Values Endpunkt, Modellbezeichner, Kontextgröße, Ausgabelimit, Standardwerte für Temperatur, Top-p, Repetition Penalty
Anwendung Administrator und App-Ersteller, in der Oberfläche Standardmodell, Modell je App, Denkaufwand je App, Temperatur je App, Anweisungen

In basebox Cloud übernimmt basebox die Inferenz-Ebene vollständig.

Die wichtigsten Parameter

Kontextgröße – wie viele Tokens ein Chat insgesamt aufnehmen kann (Fragen, Antworten, Dokumente). Sie ist eine Eigenschaft des angebundenen Modells und wird auf dem Server über AISRV_LLM_CONTEXT_SIZE gesetzt; die Seite „Über" zeigt den aktiven Wert. Für Nutzer: Kontextfenster.

Ausgabelimit – die maximale Länge einer Antwort in Tokens (AISRV_LLM_MAX_TOKENS, Standard 8000). Lange Antworten werden nicht mehr abgeschnitten; das Limit ist eine Obergrenze, kein Ziel.

Temperatur – steuert die Variabilität der Antworten (0 = fokussiert und reproduzierbar, 1 = kreativ). Der Serverstandard steht in AISRV_LLM_TEMPERATURE; je App lässt sich die Temperatur im App-Editor anpassen. Für Wissensbasis-Apps und Fachauskünfte empfiehlt sich ein niedriger Wert.

Denkaufwand (Reasoning) – bei Modellen mit Reasoning: Niedrig · Mittel · Hoch · Sehr Hoch · Maximum je App unter Erweiterte Felder. Nutzer wählen im Chat zusätzlich Niedrig/Mittel/Hoch oder schalten Reasoning ab. Mehr Aufwand = bessere Ergebnisse bei komplexen Aufgaben, aber längere Antwortzeit und mehr Tokens. Siehe Standardmodelle.

Repetition Penalty / Top-p – Feineinstellungen der Inferenz (AISRV_LLM_REPETITION_PENALTY, AISRV_LLM_TOP_P), die der Platform Operator setzt. Relevant etwa bei Modellen, die zu Wiederholungen neigen.

Wo finde ich die Einstellung

Schritt für Schritt: Eine App auf ihren Zweck abstimmen

  1. Öffnen Sie die App im App-Editor.
  2. Modell: „Standard verwenden" belassen, wenn die App kein bestimmtes Modell braucht.
  3. Denkaufwand: Niedrig für gleichförmige Aufgaben (Umformulieren, Übersetzen), Hoch oder darüber für Analysen und mehrschrittige Aufgaben.
  4. Temperatur: niedrig für Fakten und Wissensbasis-Antworten, höher für Textentwürfe und Ideen.
  5. App-Anweisungen: Antwortlänge, Format und Ton vorgeben – das wirkt oft stärker als jeder Parameter.
  6. Speichern und in der Vorschau testen.

Hinweise

Hinweis

  • Konfiguration ist kein Ersatz für Anweisungen. „Antworte in maximal fünf Sätzen" in den App-Anweisungen ist wirksamer als ein niedriges Ausgabelimit.
  • Der System-Prompt der Organisation gilt zusätzlich in jeder App – siehe System-Prompt.
  • Bei externem Inferenz-Endpunkt muss der in AISRV konfigurierte Modellbezeichner exakt dem entsprechen, was der Endpunkt unter /v1/models meldet.
  • Ändert der Platform Operator die Kontextgröße, wirkt das auf alle Chats; die Seite „Über" zeigt den neuen Wert.

Häufige Fragen

Kann ich die Kontextgröße als Administrator erhöhen? Nein. Sie ist eine Eigenschaft des angebundenen Modells und wird auf dem Server vom Platform Operator gesetzt – begrenzt durch Modell und GPU-Speicher.

Warum bekomme ich bei gleicher Frage unterschiedliche Antworten? Sprachmodelle antworten nicht deterministisch; eine niedrigere Temperatur macht Antworten reproduzierbarer.

Wo stelle ich den Reasoning-Standard für die gesamte Installation ein? Administratoren legen den Standard je App und für die gesamte Installation fest.

Gilt die App-Temperatur auch für die API? Nein. Über die API setzen Entwickler temperature je Anfrage selbst.

Benötigen Sie Hilfe? Support kontaktieren