Eigenes lokales KI-System

Ollama und vLLM

Ollama und vLLM sind Inferenzsysteme: Sie führen Sprachmodelle (LLM) aus.
Qwen und Gemma sind Sprachmodelle.

Ollama

Modelle herunterladen, lokal starten und wechseln.

vLLM

Ein Modell als Dienst für viele gleichzeitige Anfragen betreiben.

AspektOllamavLLM
BetriebsaufwandEinfacher Einstieg und Modellwechsel.Modell, Speicher und Parallelität gezielt konfigurieren.
ModellvielfaltMehrere Modelle laden und bei Bedarf wechseln.Üblicherweise ein Basismodell je Dienstinstanz.
MesswerteAntwortdauer, Modellladezeit und Tokenzahlen pro Anfrage.Antwortdauer, Tokenzahlen, Warteschlange und Zeit bis zum ersten Token.