Ollama, vLLM: Welches System braucht WSW?

Welche Inferenzsysteme gibt es?

Die Laufzeit führt das Modell aus. RAG ergänzt Wissen.

SystemVorteileGrenzenEinsatz
OllamaModelle einfach laden, starten und wechseln; lokale API.Parallelität und Kontext benötigen zusätzlich Speicher; Warteschlange bei Überlast.Einzelplätze, Pilotgruppen, wechselnde Modelle. Parallele Anfragen sind möglich.
vLLMBündelt laufende Anfragen; effizienter Kontextspeicher; Betriebskennzahlen.GPU-, Modell- und Quantisierungsunterstützung hängen von der Version ab.Gemeinsamer Modelldienst mit mehreren gleichzeitigen Nutzenden.
llama.cppKompakte Laufzeit; CPU, GPU oder gemischt; quantisierte GGUF-Modelle.Modelldateien und Serverparameter selbst verwalten; CPU-Auslagerung kostet Tempo.Lokale Anwendungen und Geräte mit begrenztem GPU-Speicher.
SGLangGemeinsame Promptanfänge wiederverwenden; Anfragen bündeln; mehrere GPUs.Modell- und Hardwareunterstützung sowie Speicherparameter prüfen.Stark genutzte Dienste, Agenten und wiederkehrender Projektkontext.
TensorRT-LLMFür NVIDIA-GPUs optimierte Berechnung und gebündelte Anfragen.An NVIDIA gebunden; Modell, Quantisierung und Bereitstellungsweg müssen passen.Dauerhaft betriebene NVIDIA-Dienste mit gezielter Leistungsoptimierung.
Triton Inference ServerBetreibt mehrere Modelle und Verarbeitungsketten mit unterschiedlichen Backends.Serverplattform; benötigt eine passende Rechenlaufzeit, etwa TensorRT-LLM oder vLLM.Gemeinsamer Betrieb von Sprachmodell, Embedding und Reranker.
LM StudioDesktop-Oberfläche zum Laden und Testen lokaler Modelle; lokale API.Oberfläche mit Laufzeiten wie llama.cpp/MLX; keine eigenständige Rechen-Engine.Modellvergleich und Prototypen am Arbeitsplatz.
OpenVINO GenAIOptimierte Inferenz auf unterstützten Intel-CPUs, GPUs und NPUs.Modellkonvertierung und passende Hardware erforderlich; kein NVIDIA-CUDA-Ersatz.Lokale Inferenz auf Intel-Systemen, auch ohne NVIDIA-GPU.

Für WSW: Modell und ABAP-Aufgaben zuerst prüfen; danach Laufzeit und Hardware mit dieser Last testen.