Ollama, vLLM: Welches System braucht WSW?
»Eigenes KI-System: Hardware und Kosten
Aufgabenarten
| Aufgabe | Modell | Kontext K | Antworttoken | Zeitannahme s |
|---|
Schätzwerte pro Modellaufruf ohne Thinking. Zeit = Verarbeitung bis zur vollständigen Antwort, ohne Warteschlange. Kontext = Eingabe + Antwort; 1 K = 1.024 Token. Bei anderer Hardware, Parallelität oder Modellwahl neu messen.
Wer macht was wie oft
| Rolle | Personen | Aufgabe | Anfragen je Person/Tag |
|---|
Server
Berechnung einstellen
Spitzenlast 3 = dreifache Anfragerate gegenüber dem Tagesmittel. Geplante Belegung 70 % = 30 % Zeitreserve je Kontextplatz. Das ist keine GPU-Auslastungsmessung.
Gewichte je Modellkopie. Ollama mit 4 Bit: Paketgröße, sofern bekannt. vLLM mit 4 Bit, ohne bekanntes Ollama-Paket und bei 8 Bit: Parameterrechnung plus 10 %. Bei 16 Bit: zwei Byte je Parameter. Kontextspeicher: 16 Bit, lokale Fenster und Hybridzustände berücksichtigt. Alle zugewiesenen Kontextplätze werden voll eingerechnet. Speicherreserve kommt auf Gewichte, Kontext und Laufzeitbedarf.
Jeder Server hat eine GPU. 20 bzw. 96 GiB sind nominelle Rechenbudgets; den nutzbaren Speicher vor Betrieb mit nvidia-smi prüfen. Modell, Quantisierung und Inferenzversion müssen zusammenpassen. Ein Modell wird hier nicht über das Netz auf mehrere GPUs aufgeteilt.
GEX44 · 20-GB-GPU · GEX131 · Ollama: Parallelität · vLLM: Verteilung
GEX44 wird wie gewünscht als 20-GB-Profil geplant. Im aktuellen Hetzner-Angebot steht auch der Nachfolger GEX45 mit 24 GB; Verfügbarkeit des GEX44 separat prüfen.
Reicht das für WSW und ABAP?
- RAG liefert passende Fachmodelle, DDIC-Definitionen, Schnittstellen und freigegebenen Code zum jeweiligen SAP-Release. Relevante Ausschnitte halten den Kontext klein.
- Ein großes Modell oder Kontextfenster belegt keine ABAP-Eignung. Eigene Aufgaben mit Syntaxprüfung, ATC und ABAP Unit bewerten.
- Bei zu langen Warteschlangen: zuerst Dauer und Kontext unter echter Last messen, dann Kontextkontingente oder Modellkopien anpassen.