
Lokales LLM ohne Cloud
Voraussetzungen
- Ein Linux-Rechner (verschiedene Distributionen möglich; die Anleitung funktioniert in der Regel unter Ubuntu/Debian/Fedora, kann aber wegen Kernel/Treiber- und Paketunterschieden variieren).
- Mindestens 8 GB RAM; für nützlichere LLMs empfehle ich 16–64 GB RAM bzw. eine GPU mit 6–24+ GB VRAM (siehe Modellwahl weiter unten).
- Docker oder Podman (rootless möglich) oder direkte native Installation von Ollama. Diese Anleitung zeigt die Docker/Native-Variante.
- Du hast ein Backup wichtiger Daten, besonders wenn du Systemänderungen ausführst.
Wichtig: Es gibt keine Garantie, dass die Schritte auf jedem System 1:1 laufen — Kernel, Treiber und Hardware unterscheiden sich.
Schritt 1: Ollama installieren (Docker + native Hinweise)
Ollama kann nativ oder per Docker laufen. Für Docker/Podman-User:
- Prüfe Docker/Podman läuft:
docker --version
# oder bei Podman
podman --version
- (Optional) Docker-Container starten:
docker run --rm -it --name ollama -p 11434:11434 quay.io/ollama/ollama:latest
Hinweis: Ollama veröffentlicht Images; überprüfe stets die offizielle Quelle. Wenn du Podman verwendest, ersetze docker durch podman. Achte auf Rootless-Betrieb, wenn du nicht als root arbeiten willst.
Native Installation (Debian/Ubuntu, Beispiel):
# Beispiel: lade Binary herunter und installiere in /usr/local/bin
curl -fsSL https://ollama.com/download/linux/ollama -o /tmp/ollama
chmod +x /tmp/ollama
sudo mv /tmp/ollama /usr/local/bin/ollama
ollama version
Prüfe die offizielle Ollama-Dokumentation für aktualisierte Downloads.
Schritt 2: Modellauswahl passend zur Hardware
Kurz: Modelle unterscheiden sich stark in RAM/VRAM-Anforderungen.
- CPU-only, 8–16 GB RAM: Mini-/Tiny-Modelle (z. B. Mistral-7B-quantized-ggjt Varianten, quantisierte LLMs). Langsam, aber lokal möglich.
- GPU (6–8 GB VRAM): 7B-Parameter quantisierte Modelle.
- GPU (12–24+ GB VRAM): 13B oder 33B-Modelle möglich; bessere Qualität.
40 GB VRAM oder Multi-GPU: Vollpräzisions-Modelle (größere LLMs).
Tipp: Quantisierte Modelle (4-bit/8-bit) sparen VRAM, reduzieren aber Genauigkeit. Lizenz: Achte auf die Lizenz des jeweiligen Modells — nicht alle Modelle sind für kommerzielle Nutzung oder Modifikationen freigegeben.
Schritt 3: Ein Modell mit Ollama herunterladen und starten
Beispiel: 7B-quantisiertes Modell (Name fiktiv — ersetze durch ein in Ollama verfügbares Modell).
# Liste verfügbarer Modelle
ollama list # oder ollama models
# Modell herunterladen (Beispielname austauschen)
ollama pull my-favorite-model
Modelle lokal starten:
ollama run my-favorite-model
# oder im Hintergrund (bei Docker wäre das container-basiert)
Wenn das Modell langsam reagiert:
- Prüfe CPU-Auslastung mit
htop/top. - Bei GPU:
nvidia-smiprüfen (NVIDIA-Treiber nötig). - Verwende quantisierte Varianten, falls VRAM limitiert.
Schritt 4: API/Integration lokal nutzen
Ollama stellt in der Regel einen lokalen API-Port bereit (z. B. 11434). Beispiel-Anfrage per curl:
curl -s -X POST "http://localhost:11434/v1/completions" \
-H "Content-Type: application/json" \
-d '{
"model": "my-favorite-model",
"prompt": "Schreibe eine kurze Zusammenfassung zu Linux-Containern."
}'
Wenn du eine Anwendung anbinden willst, nutze lokale Endpunkte — so bleiben Daten vornehmlich lokal. Dennoch: Lies die Ollama-Dokumentation, um herauszufinden, ob Telemetrie aktiv ist und wie sie deaktiviert wird.
Sicherheit & Datenschutz
- Lokale Ausführung minimiert Cloud-Datenübertragung. Dennoch: Prüfe Netzwerkverbindungen (ss, netstat) und Ollama-Konfig, um sicherzustellen, dass keine unerwünschten externen Verbindungen bestehen.
- Keine pauschale Aussage zur Datensicherheit: Konfigurationen oder Zusatz-Plugins können Telemetrie aktivieren. Lies die Lizenz- und Datenschutzdokumente der verwendeten Software/Modelle.
- Modelle haben Lizenzen — prüfe, ob die Nutzung (kommerziell, Modifikation, Redistribution) erlaubt ist.
Warnhinweise vor destruktiven Befehlen
Warnung: Die folgenden Befehle können Daten löschen oder dein System verändern. Erstelle vorher unbedingt ein Backup wichtiger Daten.
- Beispiel: Docker System Cleanup (löscht unbenutzte Images/Container)
# WARNUNG: Entfernt nicht verwendete Container, Images und Netzwerke. Backup wichtiger Daten vorher.
docker system prune -a
- Beispiel: Löschen ganzer Verzeichnisse
# WARNUNG: Löscht rekursiv. Backup vorher.
rm -rf /pfad/zum/verzeichnis
Häufige Fehler & Quick-Fixes
- Ollama-Start schlägt fehl: Prüfe Logs (
ollama logsoder Docker-Logsdocker logs <container>). Häufige Ursachen: fehlende Berechtigungen, Port bereits belegt. - Modell zu langsam: Wechsel zu quantisierter Variante oder größere RAM/VRAM bereitstellen.
- Modell lädt extern nach: Prüfe Konfigurationsdateien und Network-Monitoring; deaktiviere Telemetrie in Einstellungen, falls vorhanden.
- Unsicherheit bei API: Teste lokal mit curl, dann integriere in App.
Abschließend: Teste erst mit kleinen Modellen, bevor du größere Modelle herunterlädst. Achte auf Lizenzbedingungen der Modelle und sichere stets deine Daten vor destruktiven Befehlen. Das Team von linux.hackshelps.com ist eine unabhängige Redaktion — prüfe Hersteller-Dokumentation für endgültige Details.
Kommst du an dieser Stelle nicht weiter oder funktioniert ein Schritt bei dir anders als beschrieben? Schreib uns einfach kurz, woran es hakt – schreib uns eine E-Mail, wir schauen es uns gemeinsam an.
Passende Themen
Häufige Fragen
Sendet Ollama meine Daten an einen Server?
Beim lokalen Betrieb bleiben die Anfragen auf dem eigenen Rechner. Das gilt nicht automatisch für jede Anwendung, die auf Ollama aufsetzt - das sollte jeweils separat geprüft werden.
Welches Modell passt zu meiner Hardware?
Das hängt vor allem von verfügbarem RAM/VRAM ab. Größere Modelle liefern oft bessere Ergebnisse, benötigen aber deutlich mehr Ressourcen.
Kann ich Ollama über eine API in eigene Programme einbinden?
Ja, Ollama bietet eine lokale API-Schnittstelle dafür an. Für den Einstieg reicht ein einfacher HTTP-Aufruf gegen die lokale Adresse.