Lokales LLM ohne Cloud

Lokales LLM ohne Cloud

Voraussetzungen

Wichtig: Es gibt keine Garantie, dass die Schritte auf jedem System 1:1 laufen — Kernel, Treiber und Hardware unterscheiden sich.

Schritt 1: Ollama installieren (Docker + native Hinweise)

Ollama kann nativ oder per Docker laufen. Für Docker/Podman-User:

  1. Prüfe Docker/Podman läuft:
docker --version
# oder bei Podman
podman --version
  1. (Optional) Docker-Container starten:
docker run --rm -it --name ollama -p 11434:11434 quay.io/ollama/ollama:latest

Hinweis: Ollama veröffentlicht Images; überprüfe stets die offizielle Quelle. Wenn du Podman verwendest, ersetze docker durch podman. Achte auf Rootless-Betrieb, wenn du nicht als root arbeiten willst.

Native Installation (Debian/Ubuntu, Beispiel):

# Beispiel: lade Binary herunter und installiere in /usr/local/bin
curl -fsSL https://ollama.com/download/linux/ollama -o /tmp/ollama
chmod +x /tmp/ollama
sudo mv /tmp/ollama /usr/local/bin/ollama
ollama version

Prüfe die offizielle Ollama-Dokumentation für aktualisierte Downloads.

Schritt 2: Modellauswahl passend zur Hardware

Kurz: Modelle unterscheiden sich stark in RAM/VRAM-Anforderungen.

Tipp: Quantisierte Modelle (4-bit/8-bit) sparen VRAM, reduzieren aber Genauigkeit. Lizenz: Achte auf die Lizenz des jeweiligen Modells — nicht alle Modelle sind für kommerzielle Nutzung oder Modifikationen freigegeben.

Schritt 3: Ein Modell mit Ollama herunterladen und starten

Beispiel: 7B-quantisiertes Modell (Name fiktiv — ersetze durch ein in Ollama verfügbares Modell).

# Liste verfügbarer Modelle
ollama list # oder ollama models

# Modell herunterladen (Beispielname austauschen)
ollama pull my-favorite-model

Modelle lokal starten:

ollama run my-favorite-model
# oder im Hintergrund (bei Docker wäre das container-basiert)

Wenn das Modell langsam reagiert:

Schritt 4: API/Integration lokal nutzen

Ollama stellt in der Regel einen lokalen API-Port bereit (z. B. 11434). Beispiel-Anfrage per curl:

curl -s -X POST "http://localhost:11434/v1/completions" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "my-favorite-model",
    "prompt": "Schreibe eine kurze Zusammenfassung zu Linux-Containern."
  }'

Wenn du eine Anwendung anbinden willst, nutze lokale Endpunkte — so bleiben Daten vornehmlich lokal. Dennoch: Lies die Ollama-Dokumentation, um herauszufinden, ob Telemetrie aktiv ist und wie sie deaktiviert wird.

Sicherheit & Datenschutz

Warnhinweise vor destruktiven Befehlen

Warnung: Die folgenden Befehle können Daten löschen oder dein System verändern. Erstelle vorher unbedingt ein Backup wichtiger Daten.

# WARNUNG: Entfernt nicht verwendete Container, Images und Netzwerke. Backup wichtiger Daten vorher.
docker system prune -a
# WARNUNG: Löscht rekursiv. Backup vorher.
rm -rf /pfad/zum/verzeichnis

Häufige Fehler & Quick-Fixes

Abschließend: Teste erst mit kleinen Modellen, bevor du größere Modelle herunterlädst. Achte auf Lizenzbedingungen der Modelle und sichere stets deine Daten vor destruktiven Befehlen. Das Team von linux.hackshelps.com ist eine unabhängige Redaktion — prüfe Hersteller-Dokumentation für endgültige Details.

Kommst du an dieser Stelle nicht weiter oder funktioniert ein Schritt bei dir anders als beschrieben? Schreib uns einfach kurz, woran es hakt – schreib uns eine E-Mail, wir schauen es uns gemeinsam an.

Passende Themen

Häufige Fragen

Sendet Ollama meine Daten an einen Server?

Beim lokalen Betrieb bleiben die Anfragen auf dem eigenen Rechner. Das gilt nicht automatisch für jede Anwendung, die auf Ollama aufsetzt - das sollte jeweils separat geprüft werden.

Welches Modell passt zu meiner Hardware?

Das hängt vor allem von verfügbarem RAM/VRAM ab. Größere Modelle liefern oft bessere Ergebnisse, benötigen aber deutlich mehr Ressourcen.

Kann ich Ollama über eine API in eigene Programme einbinden?

Ja, Ollama bietet eine lokale API-Schnittstelle dafür an. Für den Einstieg reicht ein einfacher HTTP-Aufruf gegen die lokale Adresse.