Ollama, vLLM: Welches System braucht WSW?

Eigenes KI-System: Hardware und Kosten

Aufgabenarten
AufgabeModellKontext KAntworttokenZeitannahme s

Schätzwerte pro Modellaufruf ohne Thinking. Zeit = Verarbeitung bis zur vollständigen Antwort, ohne Warteschlange. Kontext = Eingabe + Antwort; 1 K = 1.024 Token. Bei anderer Hardware, Parallelität oder Modellwahl neu messen.

Wer macht was wie oft

RollePersonenAufgabeAnfragen je Person/Tag

Server

Berechnung einstellen

Spitzenlast 3 = dreifache Anfragerate gegenüber dem Tagesmittel. Geplante Belegung 70 % = 30 % Zeitreserve je Kontextplatz. Das ist keine GPU-Auslastungsmessung.

Gewichte je Modellkopie. Ollama mit 4 Bit: Paketgröße, sofern bekannt. vLLM mit 4 Bit, ohne bekanntes Ollama-Paket und bei 8 Bit: Parameterrechnung plus 10 %. Bei 16 Bit: zwei Byte je Parameter. Kontextspeicher: 16 Bit, lokale Fenster und Hybridzustände berücksichtigt. Alle zugewiesenen Kontextplätze werden voll eingerechnet. Speicherreserve kommt auf Gewichte, Kontext und Laufzeitbedarf.

Jeder Server hat eine GPU. 20 bzw. 96 GiB sind nominelle Rechenbudgets; den nutzbaren Speicher vor Betrieb mit nvidia-smi prüfen. Modell, Quantisierung und Inferenzversion müssen zusammenpassen. Ein Modell wird hier nicht über das Netz auf mehrere GPUs aufgeteilt.

GEX44 · 20-GB-GPU · GEX131 · Ollama: Parallelität · vLLM: Verteilung

GEX44 wird wie gewünscht als 20-GB-Profil geplant. Im aktuellen Hetzner-Angebot steht auch der Nachfolger GEX45 mit 24 GB; Verfügbarkeit des GEX44 separat prüfen.

Reicht das für WSW und ABAP?
  • RAG liefert passende Fachmodelle, DDIC-Definitionen, Schnittstellen und freigegebenen Code zum jeweiligen SAP-Release. Relevante Ausschnitte halten den Kontext klein.
  • Ein großes Modell oder Kontextfenster belegt keine ABAP-Eignung. Eigene Aufgaben mit Syntaxprüfung, ATC und ABAP Unit bewerten.
  • Bei zu langen Warteschlangen: zuerst Dauer und Kontext unter echter Last messen, dann Kontextkontingente oder Modellkopien anpassen.

SAP: ABAP-Unterstützung