Eigenes lokales KI-System
»Ollama und vLLM
Ollama und vLLM sind Inferenzsysteme: Sie führen Sprachmodelle (LLM) aus.
Qwen und Gemma sind Sprachmodelle.
Ollama
Modelle herunterladen, lokal starten und wechseln.
vLLM
Ein Modell als Dienst für viele gleichzeitige Anfragen betreiben.
| Aspekt | Ollama | vLLM |
|---|---|---|
| Betriebsaufwand | Einfacher Einstieg und Modellwechsel. | Modell, Speicher und Parallelität gezielt konfigurieren. |
| Modellvielfalt | Mehrere Modelle laden und bei Bedarf wechseln. | Üblicherweise ein Basismodell je Dienstinstanz. |
| Messwerte | Antwortdauer, Modellladezeit und Tokenzahlen pro Anfrage. | Antwortdauer, Tokenzahlen, Warteschlange und Zeit bis zum ersten Token. |