Ollama, vLLM: Welches System braucht WSW?
»Welche Inferenzsysteme gibt es?
Die Laufzeit führt das Modell aus. RAG ergänzt Wissen.
| System | Vorteile | Grenzen | Einsatz |
|---|---|---|---|
| Ollama | Modelle einfach laden, starten und wechseln; lokale API. | Parallelität und Kontext benötigen zusätzlich Speicher; Warteschlange bei Überlast. | Einzelplätze, Pilotgruppen, wechselnde Modelle. Parallele Anfragen sind möglich. |
| vLLM | Bündelt laufende Anfragen; effizienter Kontextspeicher; Betriebskennzahlen. | GPU-, Modell- und Quantisierungsunterstützung hängen von der Version ab. | Gemeinsamer Modelldienst mit mehreren gleichzeitigen Nutzenden. |
| llama.cpp | Kompakte Laufzeit; CPU, GPU oder gemischt; quantisierte GGUF-Modelle. | Modelldateien und Serverparameter selbst verwalten; CPU-Auslagerung kostet Tempo. | Lokale Anwendungen und Geräte mit begrenztem GPU-Speicher. |
| SGLang | Gemeinsame Promptanfänge wiederverwenden; Anfragen bündeln; mehrere GPUs. | Modell- und Hardwareunterstützung sowie Speicherparameter prüfen. | Stark genutzte Dienste, Agenten und wiederkehrender Projektkontext. |
| TensorRT-LLM | Für NVIDIA-GPUs optimierte Berechnung und gebündelte Anfragen. | An NVIDIA gebunden; Modell, Quantisierung und Bereitstellungsweg müssen passen. | Dauerhaft betriebene NVIDIA-Dienste mit gezielter Leistungsoptimierung. |
| Triton Inference Server | Betreibt mehrere Modelle und Verarbeitungsketten mit unterschiedlichen Backends. | Serverplattform; benötigt eine passende Rechenlaufzeit, etwa TensorRT-LLM oder vLLM. | Gemeinsamer Betrieb von Sprachmodell, Embedding und Reranker. |
| LM Studio | Desktop-Oberfläche zum Laden und Testen lokaler Modelle; lokale API. | Oberfläche mit Laufzeiten wie llama.cpp/MLX; keine eigenständige Rechen-Engine. | Modellvergleich und Prototypen am Arbeitsplatz. |
| OpenVINO GenAI | Optimierte Inferenz auf unterstützten Intel-CPUs, GPUs und NPUs. | Modellkonvertierung und passende Hardware erforderlich; kein NVIDIA-CUDA-Ersatz. | Lokale Inferenz auf Intel-Systemen, auch ohne NVIDIA-GPU. |
Für WSW: Modell und ABAP-Aufgaben zuerst prüfen; danach Laufzeit und Hardware mit dieser Last testen.