
Ollama model api
Voraussetzungen
- Linux mit systemd (Anleitungen können je Distribution variieren). Kernel/Distribution/Hardware können Verhalten beeinflussen — es kann nötig sein, Paketwege oder Befehle anzupassen.
- Mindestens 8–16 GB RAM; für größere LLMs ist mehr RAM/VRAM nötig (siehe Modellbeschreibung).
- Ollama-Client (binary) installiert. Wenn du eine andere Installationsmethode verwendest (z. B. Paketmanager, Homebrew, Distribution-Build), können Pfade/Service-Namen abweichen.
- Grundkenntnisse: Terminal, curl, Python 3.8+ und pip.
Wichtig: Modelle haben unterschiedliche Lizenzen. Lies die Lizenz/Terms des jeweiligen Modells bevor du es produktiv nutzt.
Schritt 1: Ollama installieren (kurz)
Offizielle Installationswege können sich ändern. Lade das offizielle Binary/Package von der Ollama-Website oder nutze den Paketmanager deiner Distribution. Beispiel, generischer Ablauf (als Vorlage; ersetze URL/Dateiname durch die aktuelle von Ollama):
# Beispiel: .deb herunterladen und installieren (ersetzt URL durch aktuelle)
wget https://ollama.example/ollama_amd64.deb -O /tmp/ollama.deb
sudo apt install /tmp/ollama.deb
Wenn du eine Paket- oder Distribution-spezifische Anleitung nutzt, folge der offiziellen Anleitung. Prüfe nach der Installation:
ollama --version
Wenn das nicht funktioniert: prüfe $PATH oder ob das Binary unter /usr/local/bin liegt.
Schritt 2: Ein Modell herunterladen (pull)
Wähle ein Modell, das zu deiner Hardware passt. Kleine Modelle laufen auf CPUs, große benötigen GPU/VRAM. Schau dir im Modell-Repository/Feed die RAM/VRAM-Angaben an.
Beispiel: Modell herunterladen (ersetze “modelname” durch echten Modellnamen):
ollama pull modelname
Fehlerbehandlung:
- Wenn der Download sehr langsam ist, prüfe Netzwerk/Proxy.
- Wenn zu wenig Speicher verfügbar ist, wähle ein kleineres Modell.
Lizenzhinweis: Prüfe Lizenz/Terms des Modells. Nicht jedes Modell darf kommerziell oder ohne Attribution verwendet werden.
Schritt 3: Ollama-API-Server starten
Ollama kann lokal einen HTTP-API-Endpoint bereitstellen. Starte den Server mit:
ollama serve
Der Server gibt typischerweise Port und Endpoint aus (z. B. 127.0.0.1:11434). Wenn du den Port anpassen musst, nutze Optionen des CLI (siehe ollama serve --help).
Wenn du den Server als systemd-Service betreiben willst, erstelle eine Service-Datei. Warnung: Änderung an systemd/system kann Systemverhalten beeinflussen — sichere wichtige Daten vorher.
Beispiel systemd (als Vorlage, passe Pfade an):
# /etc/systemd/system/ollama.service (Vorlage)
[Unit]
Description=Ollama local API
After=network.target
[Service]
Type=simple
ExecStart=/usr/local/bin/ollama serve
Restart=on-failure
User=ollamauser
Group=ollamauser
[Install]
WantedBy=multi-user.target
Nach dem Anlegen:
sudo systemctl daemon-reload
sudo systemctl enable --now ollama.service
sudo journalctl -u ollama.service -f
Achte auf Sicherheitsaspekte: öffne den API-Port nicht ungeschützt im LAN/Internet. Wenn du Zugriff remote brauchst, nutze ein Reverse-Proxy mit Auth/HTTPS oder SSH-Tunnel. Niemals den API-Port offen lassen ohne Authentifizierung.
Schritt 4: Lokale API nutzen — curl-Beispiel
Prüfe zuerst, ob der Server läuft (ersetze Host/Port durch die Ausgabe von ollama serve):
curl -sS http://127.0.0.1:11434/health
Typisches Request-Beispiel: Text-Completion (Endpoint kann je Version variieren; ersetze /v1/generate ggf. durch die tatsächliche Route, siehe ollama --help):
curl -X POST "http://127.0.0.1:11434/v1/generate" \
-H "Content-Type: application/json" \
-d '{
"model": "modelname",
"prompt": "Schreibe eine kurze Zusammenfassung zur Quantenmechanik in 3 Sätzen.",
"max_tokens": 256
}'
Wenn der Endpoint anders heißt, nutze die von ollama serve/CLI dokumentierte Route.
Schritt 5: Python-Integration (requests)
Ein einfaches Python-Beispiel mit requests:
import requests
API_URL = "http://127.0.0.1:11434/v1/generate" # anpassen falls nötig
payload = {
"model": "modelname",
"prompt": "Erkläre Docker in einem Satz.",
"max_tokens": 128
}
resp = requests.post(API_URL, json=payload, timeout=30)
resp.raise_for_status()
print(resp.json())
Fehler: Bei Timeout erhöhe Timeout-Wert, bei Verbindungsfehlern prüfe, ob ollama serve läuft und ob Firewall/Loopback den Zugriff blockiert.
Wie verwalte ich API-Keys / Auth?
Ollama auf lokaler Maschine braucht typischerweise keinen externen API-Key. Wenn du Auth wünschst:
- Verwende einen Reverse-Proxy (nginx/traefik) vor dem Endpoint und setze Basic Auth oder JWT.
- Für Remote-Zugriff: zwinge HTTPS und Authentifizierung, dokumentiere und rotiere Keys.
Warnung: Öffne niemals die lokale API ungeschützt ins Internet. Wenn du öffentliche Keys speicherst, verwende sichere Secrets-Storage (Vault, OS Keyring) und rotiere Keys regelmäßig.
Häufige Fehler & Troubleshooting
- Modell reagiert extrem langsam: Prüfe, ob Modell auf CPU läuft; für GPU-Beschleunigung müssen passende CUDA-Treiber/Toolkit installiert sein. Prüfe RAM/VRAM-Auslastung (top, nvidia-smi).
- „Port bereits belegt“ beim Starten von
ollama serve: Finde Prozess mitss -ltnpoderlsof -i :PORTund beende ihn, wenn es sinnvoll ist. - Unsicherheit ob Daten extern gesendet werden: Lokale Ollama-Instanz verarbeitet in der Regel lokal, aber Bibliothek/Model-Repo oder zusätzliche Telemetrie können anders sein. Lies die Dokumentation und Netzwerkanfragen (z. B. mit
ssodertcpdump) wenn nötig. - Modell-Download bricht ab: Prüfe genügend Speicherplatz (
df -h) und Bandbreite.
Warnhinweis bei destruktiven Befehlen
Vor jedem destruktiven Befehl (z. B. rm -rf, --force, docker system prune) mache ein Backup deiner Daten. Die Anleitung enthält keine automatischen Löschbefehle, aber wenn du Platz schaffen musst, sichere zuerst.
Diese Anleitung gibt die nötigen praktischen Schritte, um Ollama lokal zu betreiben, ein Modell zu laden und per HTTP/Python darauf zuzugreifen. Hardware- und OS-Unterschiede sowie Modell-Lizenzbedingungen können Anpassungen nötig machen — prüfe immer die aktuelle Ollama- und Modell-Dokumentation.
Kommst du an dieser Stelle nicht weiter oder funktioniert ein Schritt bei dir anders als beschrieben? Schreib uns einfach kurz, woran es hakt – schreib uns eine E-Mail, wir schauen es uns gemeinsam an.
Passende Themen
- Welches Linux Mint für alten Laptop?
- How to install docker linux mint
- Ollama Modell auswählen
- Lokales LLM ohne Cloud
Häufige Fragen
Sendet Ollama meine Daten an einen Server?
Beim lokalen Betrieb bleiben die Anfragen auf dem eigenen Rechner. Das gilt nicht automatisch für jede Anwendung, die auf Ollama aufsetzt - das sollte jeweils separat geprüft werden.
Welches Modell passt zu meiner Hardware?
Das hängt vor allem von verfügbarem RAM/VRAM ab. Größere Modelle liefern oft bessere Ergebnisse, benötigen aber deutlich mehr Ressourcen.
Kann ich Ollama über eine API in eigene Programme einbinden?
Ja, Ollama bietet eine lokale API-Schnittstelle dafür an. Für den Einstieg reicht ein einfacher HTTP-Aufruf gegen die lokale Adresse.