Ollama model api

Ollama model api

Voraussetzungen

Wichtig: Modelle haben unterschiedliche Lizenzen. Lies die Lizenz/Terms des jeweiligen Modells bevor du es produktiv nutzt.

Schritt 1: Ollama installieren (kurz)

Offizielle Installationswege können sich ändern. Lade das offizielle Binary/Package von der Ollama-Website oder nutze den Paketmanager deiner Distribution. Beispiel, generischer Ablauf (als Vorlage; ersetze URL/Dateiname durch die aktuelle von Ollama):

# Beispiel: .deb herunterladen und installieren (ersetzt URL durch aktuelle)
wget https://ollama.example/ollama_amd64.deb -O /tmp/ollama.deb
sudo apt install /tmp/ollama.deb

Wenn du eine Paket- oder Distribution-spezifische Anleitung nutzt, folge der offiziellen Anleitung. Prüfe nach der Installation:

ollama --version

Wenn das nicht funktioniert: prüfe $PATH oder ob das Binary unter /usr/local/bin liegt.

Schritt 2: Ein Modell herunterladen (pull)

Wähle ein Modell, das zu deiner Hardware passt. Kleine Modelle laufen auf CPUs, große benötigen GPU/VRAM. Schau dir im Modell-Repository/Feed die RAM/VRAM-Angaben an.

Beispiel: Modell herunterladen (ersetze “modelname” durch echten Modellnamen):

ollama pull modelname

Fehlerbehandlung:

Lizenzhinweis: Prüfe Lizenz/Terms des Modells. Nicht jedes Modell darf kommerziell oder ohne Attribution verwendet werden.

Schritt 3: Ollama-API-Server starten

Ollama kann lokal einen HTTP-API-Endpoint bereitstellen. Starte den Server mit:

ollama serve

Der Server gibt typischerweise Port und Endpoint aus (z. B. 127.0.0.1:11434). Wenn du den Port anpassen musst, nutze Optionen des CLI (siehe ollama serve --help).

Wenn du den Server als systemd-Service betreiben willst, erstelle eine Service-Datei. Warnung: Änderung an systemd/system kann Systemverhalten beeinflussen — sichere wichtige Daten vorher.

Beispiel systemd (als Vorlage, passe Pfade an):

# /etc/systemd/system/ollama.service (Vorlage)
[Unit]
Description=Ollama local API
After=network.target

[Service]
Type=simple
ExecStart=/usr/local/bin/ollama serve
Restart=on-failure
User=ollamauser
Group=ollamauser

[Install]
WantedBy=multi-user.target

Nach dem Anlegen:

sudo systemctl daemon-reload
sudo systemctl enable --now ollama.service
sudo journalctl -u ollama.service -f

Achte auf Sicherheitsaspekte: öffne den API-Port nicht ungeschützt im LAN/Internet. Wenn du Zugriff remote brauchst, nutze ein Reverse-Proxy mit Auth/HTTPS oder SSH-Tunnel. Niemals den API-Port offen lassen ohne Authentifizierung.

Schritt 4: Lokale API nutzen — curl-Beispiel

Prüfe zuerst, ob der Server läuft (ersetze Host/Port durch die Ausgabe von ollama serve):

curl -sS http://127.0.0.1:11434/health

Typisches Request-Beispiel: Text-Completion (Endpoint kann je Version variieren; ersetze /v1/generate ggf. durch die tatsächliche Route, siehe ollama --help):

curl -X POST "http://127.0.0.1:11434/v1/generate" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "modelname",
    "prompt": "Schreibe eine kurze Zusammenfassung zur Quantenmechanik in 3 Sätzen.",
    "max_tokens": 256
  }'

Wenn der Endpoint anders heißt, nutze die von ollama serve/CLI dokumentierte Route.

Schritt 5: Python-Integration (requests)

Ein einfaches Python-Beispiel mit requests:

import requests

API_URL = "http://127.0.0.1:11434/v1/generate"  # anpassen falls nötig
payload = {
    "model": "modelname",
    "prompt": "Erkläre Docker in einem Satz.",
    "max_tokens": 128
}
resp = requests.post(API_URL, json=payload, timeout=30)
resp.raise_for_status()
print(resp.json())

Fehler: Bei Timeout erhöhe Timeout-Wert, bei Verbindungsfehlern prüfe, ob ollama serve läuft und ob Firewall/Loopback den Zugriff blockiert.

Wie verwalte ich API-Keys / Auth?

Ollama auf lokaler Maschine braucht typischerweise keinen externen API-Key. Wenn du Auth wünschst:

Warnung: Öffne niemals die lokale API ungeschützt ins Internet. Wenn du öffentliche Keys speicherst, verwende sichere Secrets-Storage (Vault, OS Keyring) und rotiere Keys regelmäßig.

Häufige Fehler & Troubleshooting

Warnhinweis bei destruktiven Befehlen

Vor jedem destruktiven Befehl (z. B. rm -rf, --force, docker system prune) mache ein Backup deiner Daten. Die Anleitung enthält keine automatischen Löschbefehle, aber wenn du Platz schaffen musst, sichere zuerst.


Diese Anleitung gibt die nötigen praktischen Schritte, um Ollama lokal zu betreiben, ein Modell zu laden und per HTTP/Python darauf zuzugreifen. Hardware- und OS-Unterschiede sowie Modell-Lizenzbedingungen können Anpassungen nötig machen — prüfe immer die aktuelle Ollama- und Modell-Dokumentation.

Kommst du an dieser Stelle nicht weiter oder funktioniert ein Schritt bei dir anders als beschrieben? Schreib uns einfach kurz, woran es hakt – schreib uns eine E-Mail, wir schauen es uns gemeinsam an.

Passende Themen

Häufige Fragen

Sendet Ollama meine Daten an einen Server?

Beim lokalen Betrieb bleiben die Anfragen auf dem eigenen Rechner. Das gilt nicht automatisch für jede Anwendung, die auf Ollama aufsetzt - das sollte jeweils separat geprüft werden.

Welches Modell passt zu meiner Hardware?

Das hängt vor allem von verfügbarem RAM/VRAM ab. Größere Modelle liefern oft bessere Ergebnisse, benötigen aber deutlich mehr Ressourcen.

Kann ich Ollama über eine API in eigene Programme einbinden?

Ja, Ollama bietet eine lokale API-Schnittstelle dafür an. Für den Einstieg reicht ein einfacher HTTP-Aufruf gegen die lokale Adresse.