Eigenes lokales KI-System
»Lokale Modelle
| Modell | Einsatz | Ollama 4-Bit-Beispiel | vLLM Modell-ID | GPU-Schätzung ca. GiB | GEX44 20 GiB | GEX131 96 GiB |
|---|
Rechnung und Grenzen
Ollama bei 4 Bit: Größe des verlinkten Modellpakets einschließlich Bildprojektor, soweit vorhanden. vLLM: Parameterschätzung, unter 16 Bit mit 10 % Zuschlag. Die gewählte Grundlage steht am Speicherwert; beide sind keine gemessene GPU-Belegung.
8/16 Bit: Rechenvarianten aus der vollständigen Parameterzahl; bei 8 Bit mit 10 % Zuschlag. Ein passender Checkpoint und GPU-Kernel müssen verfügbar sein. Auch bei MoE liegen alle Expertengewichte im Speicher.
Zusätzlich: Kontextspeicher in 16 Bit, lokale Aufmerksamkeitsfenster und feste Hybridzustände; dann Laufzeitbedarf und Reserve. Lokale Fenster setzen eine Laufzeit voraus, die diese Speicherbegrenzung unterstützt. Bild-/Audiopuffer und reale Spitzenbelegung gesondert messen.
„Speicher reicht“ bedeutet: innerhalb des gewählten Speicherbudgets auf einer GPU, ohne CPU-Auslagerung. „Reserve fehlt“: Gewichte, Kontext und Laufzeit passen, die geplante Reserve nicht. Es belegt weder Antwortgeschwindigkeit noch ABAP-Qualität. Ein langer Kontext oder mehrere gleichzeitige Anfragen können weitere GPUs erfordern.
Die Links nennen lokale Ollama-Tags bzw. Modellfamilien für vLLM. Die Modell-ID allein legt weder Quantisierungspaket noch passende Inferenzversion fest. Der Speicherfilter belegt keine lauffähige Installation.
GEX44 / 20-GB-GPU und GEX131 / 96-GB-GPU: nominelle Rechenbudgets, nutzbaren Speicher vor Betrieb prüfen. Im aktuellen Angebot gibt es auch den GEX45 mit 24 GB.