Eigenes lokales KI-System

Lokale Modelle

ModellEinsatzOllama
4-Bit-Beispiel
vLLM
Modell-ID
GPU-Schätzung
ca. GiB
GEX44
20 GiB
GEX131
96 GiB
Rechnung und Grenzen

Ollama bei 4 Bit: Größe des verlinkten Modellpakets einschließlich Bildprojektor, soweit vorhanden. vLLM: Parameterschätzung, unter 16 Bit mit 10 % Zuschlag. Die gewählte Grundlage steht am Speicherwert; beide sind keine gemessene GPU-Belegung.

8/16 Bit: Rechenvarianten aus der vollständigen Parameterzahl; bei 8 Bit mit 10 % Zuschlag. Ein passender Checkpoint und GPU-Kernel müssen verfügbar sein. Auch bei MoE liegen alle Expertengewichte im Speicher.

Zusätzlich: Kontextspeicher in 16 Bit, lokale Aufmerksamkeitsfenster und feste Hybridzustände; dann Laufzeitbedarf und Reserve. Lokale Fenster setzen eine Laufzeit voraus, die diese Speicherbegrenzung unterstützt. Bild-/Audiopuffer und reale Spitzenbelegung gesondert messen.

„Speicher reicht“ bedeutet: innerhalb des gewählten Speicherbudgets auf einer GPU, ohne CPU-Auslagerung. „Reserve fehlt“: Gewichte, Kontext und Laufzeit passen, die geplante Reserve nicht. Es belegt weder Antwortgeschwindigkeit noch ABAP-Qualität. Ein langer Kontext oder mehrere gleichzeitige Anfragen können weitere GPUs erfordern.

Die Links nennen lokale Ollama-Tags bzw. Modellfamilien für vLLM. Die Modell-ID allein legt weder Quantisierungspaket noch passende Inferenzversion fest. Der Speicherfilter belegt keine lauffähige Installation.

GEX44 / 20-GB-GPU und GEX131 / 96-GB-GPU: nominelle Rechenbudgets, nutzbaren Speicher vor Betrieb prüfen. Im aktuellen Angebot gibt es auch den GEX45 mit 24 GB.