Ollama Modell auswählen

Du solltest dein Ollama-Modell nach verfügbarem RAM/VRAM, gewünschter Latenz und Lizenz auswählen: kleine/quantisierte Modelle brauchen wenig RAM/VRAM und sind schneller, große Modelle liefern bessere Qualität brauchen aber mehr VRAM/Arbeitsspeicher. Prüfe zuerst Hardware, dann verfügbare Modelle mit `ollama list`, teste ein leichtes Modell und steigere bei Bedarf.

Voraussetzungen

Schritt 1: Hardware prüfen

Ermittle RAM und VRAM, um Modelle sinnvoll zu wählen.

macOS:

# System-RAM
sysctl hw.memsize
# Bei Apple Silicon: VRAM = Teil des Unified Memory; nutze Activity Monitor zur Kontrolle

Linux:

# System-RAM
free -h
# GPU VRAM (NVIDIA)
nvidia-smi --query-gpu=memory.total --format=csv
# AMD: radeontop / lspci + Dokumentation prüfen

Notiz: Apple Silicon verwendet Unified Memory — eine VRAM-Angabe im klassischen Sinn fehlt. Plane konservativ: bei 8 GB Unified Memory sind nur ~4–6 GB realistisch für ein Modell verfügbar.

Schritt 2: Modelle kategorisieren (Praktische Orientierung)

Lizenzhinweis: Modelle haben unterschiedliche Lizenzen (Open, Research, Commercial). Lies die jeweiligen Lizenzdateien vor produktiver Nutzung.

Schritt 3: Verfügbare Ollama-Modelle anzeigen und herunterladen

Liste lokal verfügbarer und remote gelisteter Modelle:

ollama list

Ein Modell herunterladen (pull):

ollama pull <modellname>
# Beispiel: ollama pull llama2-7b-q4

Wenn ein Download fehlschlägt: prüfe Netzwerk, genügend Festplattenspeicher (df -h) und Ollama-Logs (~/.ollama/logs oder ollama logs falls vorhanden).

Schritt 4: Modell passend zur Hardware testen

Starte ein schnelles Query, um Latenz und OOM-Risiko zu prüfen:

ollama run <modellname> --prompt "Hallo" --max-length 64

Beurteile:

Tipp: Quantisierte Modelle (Q4/Q8) reduzieren VRAM deutlich; Qualitätseinbußen können aber sichtbar sein.

Schritt 5: GPU-Beschleunigung prüfen und konfigurieren

Ollama erkennt meist GPU automatisch. Auf macOS (Apple Silicon) nutze Apple Neural Engine/Metal-Backend, unter Linux meist CUDA für NVIDIA. Prüfe in Ollama-Logs, ob GPU genutzt wird. Bei Problemen mit GPU-Fallback: nutze CPU-Only als Test, ist langsamer:

ollama run <modellname> --device cpu --prompt "Test"

Warnung: Aktivieren experimenteller Treiber oder unsichere Kernel-Patches kann dein System gefährden; folge nur offiziellen Treiberanleitungen des Herstellers.

Schritt 6: Integration (lokale API) und Datenschutz

Ollama bietet lokale API-Endpunkte:

ollama serve
# Dann Anfragen z.B. per curl an http://localhost:11434

Datenschutz: Lokale Modelle senden standardmäßig keine Nutzdaten nach außen, aber überprüfe:

Häufige Fehler und Lösungen

Warnhinweis vor destruktiven Befehlen: Wenn du Festplattenswap erweiterst oder alte Modelle entfernst, kann das zu Datenverlust führen. Erstelle vorher ein Backup. Beispiel sicherer Modell-Entfernen-Befehl:

# Vorsicht: entfernt ein lokal gespeichertes Modell
ollama remove <modellname>

Prüfe Lizenz und Backup bevor du entfernst.

Wenn du konkrete Hardwaredaten (RAM/VRAM, CPU/GPU, macOS/Linux) nennst, gebe ich eine präzisere Modell-Empfehlung inklusive konkreter Modellnamen und erwarteter VRAM-/RAM-Anforderungen.

Kommst du an dieser Stelle nicht weiter oder funktioniert ein Schritt bei dir anders als beschrieben? Schreib uns einfach kurz, woran es hakt – schreib uns eine E-Mail, wir schauen es uns gemeinsam an.

Passende Themen

Häufige Fragen

Sendet Ollama meine Daten an einen Server?

Beim lokalen Betrieb bleiben die Anfragen auf dem eigenen Rechner. Das gilt nicht automatisch für jede Anwendung, die auf Ollama aufsetzt - das sollte jeweils separat geprüft werden.

Welches Modell passt zu meiner Hardware?

Das hängt vor allem von verfügbarem RAM/VRAM ab. Größere Modelle liefern oft bessere Ergebnisse, benötigen aber deutlich mehr Ressourcen.

Kann ich Ollama über eine API in eigene Programme einbinden?

Ja, Ollama bietet eine lokale API-Schnittstelle dafür an. Für den Einstieg reicht ein einfacher HTTP-Aufruf gegen die lokale Adresse.