Ollama Modell auswählen
Du solltest dein Ollama-Modell nach verfügbarem RAM/VRAM, gewünschter Latenz und Lizenz auswählen: kleine/quantisierte Modelle brauchen wenig RAM/VRAM und sind schneller, große Modelle liefern bessere Qualität brauchen aber mehr VRAM/Arbeitsspeicher. Prüfe zuerst Hardware, dann verfügbare Modelle mit `ollama list`, teste ein leichtes Modell und steigere bei Bedarf.
Voraussetzungen
- Ollama ist installiert und lauffähig auf deinem mac (oder Linux). Installationsfehler sind abhängig von System; hier keine Installationsanleitung.
- Du kennst den verfügbaren RAM (System‑RAM) und die GPU‑VRAM-Größe (falls GPU-Beschleunigung genutzt wird).
- Netzwerkzugang zum Herunterladen der Modelle.
Schritt 1: Hardware prüfen
Ermittle RAM und VRAM, um Modelle sinnvoll zu wählen.
macOS:
# System-RAM
sysctl hw.memsize
# Bei Apple Silicon: VRAM = Teil des Unified Memory; nutze Activity Monitor zur Kontrolle
Linux:
# System-RAM
free -h
# GPU VRAM (NVIDIA)
nvidia-smi --query-gpu=memory.total --format=csv
# AMD: radeontop / lspci + Dokumentation prüfen
Notiz: Apple Silicon verwendet Unified Memory — eine VRAM-Angabe im klassischen Sinn fehlt. Plane konservativ: bei 8 GB Unified Memory sind nur ~4–6 GB realistisch für ein Modell verfügbar.
Schritt 2: Modelle kategorisieren (Praktische Orientierung)
- Tiny/Small (z. B. quantisierte 7B Q4): ~2–6 GB VRAM, eignet sich für schnelle Tests und niedrige Latenz.
- Medium (z. B. 7B float oder 13B quantisiert): ~6–12 GB VRAM oder RAM, bessere Qualität.
- Large (13B float, 30B+): 16+ GB VRAM oder umfangreicher Swap/CPU-RAM, langsamer, meist nicht auf Laptops praktikabel.
- Spitzenmodelle (Larger than 30B): oft nur serverseitig praktikabel, prüfen Lizenz.
Lizenzhinweis: Modelle haben unterschiedliche Lizenzen (Open, Research, Commercial). Lies die jeweiligen Lizenzdateien vor produktiver Nutzung.
Schritt 3: Verfügbare Ollama-Modelle anzeigen und herunterladen
Liste lokal verfügbarer und remote gelisteter Modelle:
ollama list
Ein Modell herunterladen (pull):
ollama pull <modellname>
# Beispiel: ollama pull llama2-7b-q4
Wenn ein Download fehlschlägt: prüfe Netzwerk, genügend Festplattenspeicher (df -h) und Ollama-Logs (~/.ollama/logs oder ollama logs falls vorhanden).
Schritt 4: Modell passend zur Hardware testen
Starte ein schnelles Query, um Latenz und OOM-Risiko zu prüfen:
ollama run <modellname> --prompt "Hallo" --max-length 64
Beurteile:
- Startzeit (Laden in RAM/VRAM)
- Antwortzeit
- Falls Out‑of‑Memory-Fehler: Modell zu groß — nächstes kleiners Modell testen oder quantisierte Version wählen.
Tipp: Quantisierte Modelle (Q4/Q8) reduzieren VRAM deutlich; Qualitätseinbußen können aber sichtbar sein.
Schritt 5: GPU-Beschleunigung prüfen und konfigurieren
Ollama erkennt meist GPU automatisch. Auf macOS (Apple Silicon) nutze Apple Neural Engine/Metal-Backend, unter Linux meist CUDA für NVIDIA. Prüfe in Ollama-Logs, ob GPU genutzt wird. Bei Problemen mit GPU-Fallback: nutze CPU-Only als Test, ist langsamer:
ollama run <modellname> --device cpu --prompt "Test"
Warnung: Aktivieren experimenteller Treiber oder unsichere Kernel-Patches kann dein System gefährden; folge nur offiziellen Treiberanleitungen des Herstellers.
Schritt 6: Integration (lokale API) und Datenschutz
Ollama bietet lokale API-Endpunkte:
ollama serve
# Dann Anfragen z.B. per curl an http://localhost:11434
Datenschutz: Lokale Modelle senden standardmäßig keine Nutzdaten nach außen, aber überprüfe:
- ob Ollama Telemetrie aktiviert ist (in Konfiguration),
- ob das Modell externe Abhängigkeiten nutzt (z. B. Lizenz‑ oder Abfrageprüfung). Konfigurationsdateien durchsehen und Telemetrie deaktivieren, falls gewünscht.
Häufige Fehler und Lösungen
- Fehler: Modell lädt, aber sehr langsam → Ursache: kein GPU/zu wenig RAM. Lösung: kleinere/quantisierte Version testen oder Swap erweitern (Risiko: sehr langsame Performance).
- Fehler: Download bricht ab → Check Festplattenspeicher, Proxy/Firewall, ollama logs.
- Unsicherheit Lizenz → Lies LICENSE/README im Modellordner vor Einsatz in Produktion.
Warnhinweis vor destruktiven Befehlen: Wenn du Festplattenswap erweiterst oder alte Modelle entfernst, kann das zu Datenverlust führen. Erstelle vorher ein Backup. Beispiel sicherer Modell-Entfernen-Befehl:
# Vorsicht: entfernt ein lokal gespeichertes Modell
ollama remove <modellname>
Prüfe Lizenz und Backup bevor du entfernst.
Wenn du konkrete Hardwaredaten (RAM/VRAM, CPU/GPU, macOS/Linux) nennst, gebe ich eine präzisere Modell-Empfehlung inklusive konkreter Modellnamen und erwarteter VRAM-/RAM-Anforderungen.
Kommst du an dieser Stelle nicht weiter oder funktioniert ein Schritt bei dir anders als beschrieben? Schreib uns einfach kurz, woran es hakt – schreib uns eine E-Mail, wir schauen es uns gemeinsam an.
Passende Themen
- Welches Linux Mint für alten Laptop?
- Welches Linux Mint für alten Laptop?
- Lokales LLM ohne Cloud
- Buildah
Häufige Fragen
Sendet Ollama meine Daten an einen Server?
Beim lokalen Betrieb bleiben die Anfragen auf dem eigenen Rechner. Das gilt nicht automatisch für jede Anwendung, die auf Ollama aufsetzt - das sollte jeweils separat geprüft werden.
Welches Modell passt zu meiner Hardware?
Das hängt vor allem von verfügbarem RAM/VRAM ab. Größere Modelle liefern oft bessere Ergebnisse, benötigen aber deutlich mehr Ressourcen.
Kann ich Ollama über eine API in eigene Programme einbinden?
Ja, Ollama bietet eine lokale API-Schnittstelle dafür an. Für den Einstieg reicht ein einfacher HTTP-Aufruf gegen die lokale Adresse.