
ChatGPT, Gemini oder Claude zeigen, was moderne KI leisten kann. Doch warum muss die KI immer in der Cloud laufen? Mit Ollama können Large Language Models direkt auf einem Linux-PC, einer Workstation oder einem Server ausgeführt werden. Bei lokal ausgeführten Modellen werden Prompts und Antworten laut Ollama nicht an Ollama übertragen; optionale Cloud-Modelle sind getrennt zu betrachten.
Im einfachsten Fall besteht die Installation aus einem Befehl. Diese Anleitung zeigt, wie du Ollama unter Linux installierst, konfigurierst und für deine erste lokale KI verwendest.
Was ist Ollama?
Ollama ist eine Laufzeitumgebung für Large Language Models (LLMs). Sie übernimmt Download und Verwaltung von Modellen, CPU- und GPU-Ausführung, Kommandozeilenbetrieb und eine lokale REST-API. Die aktuelle CLI kann außerdem unterstützte Coding-Werkzeuge und Entwicklungsumgebungen konfigurieren und starten.
Warum KI lokal betreiben?
1. Daten bleiben lokal
Beim lokalen Betrieb verarbeitet das eigene System Eingaben und Antworten. Das ist für internen Code, Dokumente, Wissensdatenbanken, RAG- und Testsysteme interessant. „Lokal“ bedeutet jedoch nicht automatisch DSGVO-konform: Daten, Modelllizenz, Zugriffsschutz und Betriebsprozesse bleiben zu prüfen.
2. Keine Kosten pro lokaler Anfrage
Nach dem Modelldownload fallen keine klassischen API-Kosten pro Token an. Dafür werden eigene CPU-, RAM-, Storage- und eventuell GPU-Ressourcen benötigt.
3. Ohne permanente Cloud-Verbindung
Ein vorhandenes lokales Modell kann grundsätzlich offline laufen. Downloads, Updates und optionale Cloud-Funktionen benötigen weiterhin Internet.
4. Integration in Anwendungen
Ollama stellt standardmäßig eine API unter http://localhost:11434/api bereit.
Voraussetzungen unter Linux
Offizielle Pakete gibt es für AMD64/x86-64 und ARM64. Eine GPU ist nicht zwingend; Modellgröße, Quantisierung und Kontextlänge bestimmen RAM- und VRAM-Bedarf. Starte auf schwächerer Hardware mit einem kleineren Modell.
Schritt 1: Ubuntu oder Debian aktualisieren
sudo apt update
sudo apt upgrade -y
sudo apt install curl -y
uname -mTypische Architekturausgaben sind x86_64 und aarch64.
Schritt 2: Ollama unter Linux installieren
curl -fsSL https://ollama.com/install.sh | sh
ollama -vPrüfe heruntergeladene Installationsskripte vor der Ausführung, besonders auf administrierten Systemen. Der Befehl stammt aus der offiziellen Linux-Anleitung.
Schritt 3: Ollama-Dienst prüfen
sudo systemctl status ollama
sudo systemctl start ollama
sudo systemctl enable ollamaDie Startup-Service-Konfiguration wird für systemd-Systeme offiziell empfohlen.
Schritt 4: Erstes lokales Modell starten
ollama run gemma3Fehlt das Modell, lädt Ollama es zuerst herunter und öffnet danach die interaktive Eingabe. Frage etwa: Erkläre mir Docker in fünf einfachen Sätzen.
Codex CLI als Coding-Agent unter Linux installieren und nutzen (Zum Artikel)
Modelle verwalten
# herunterladen
ollama pull gemma3
# starten
ollama run gemma3
# lokal verfügbare Modelle
ollama ls
# laufende Modelle und CPU/GPU-Nutzung
ollama ps
# entfernen
ollama rm gemma3Die Befehle sind Teil der offiziellen CLI-Referenz. ollama ps zeigt auch, ob ein Modell auf CPU, GPU oder gemischt geladen ist.
Ollama mit NVIDIA-GPU
Die konkrete Unterstützung hängt unter anderem von GPU-Generation, Compute Capability und Treiber ab. Prüfe den NVIDIA-Treiber mit:
nvidia-smi
ollama ps100% GPU bedeutet, dass das Modell vollständig im GPU-Speicher liegt. Beachte die aktuelle Ollama-Hardwareliste.
Ollama mit AMD-GPU
Unter Linux verlangt der dokumentierte ROCm-Weg derzeit ROCm v7. Zusätzliche GPU-Unterstützung gibt es über Vulkan. Prüfe vorab die aktuelle Kompatibilitätsliste; für eine manuelle Installation gibt es ein zusätzliches ROCm-Paket.
Ollama ohne GPU
Modelle können vollständig über CPU und Arbeitsspeicher laufen. Das ist langsamer, reicht aber häufig für Tests, kleinere Modelle und einfache Automatisierungen.
Passendes Produkt in meinem Shop
Linux Mint ohne Frust — Praxisratgeber
Der deutschsprachige Praxisratgeber ergänzt Installation, Terminalarbeit und systematische Fehlersuche unter Linux.
Ollama API verwenden
curl http://localhost:11434/api/generate -d '{
"model": "gemma3",
"prompt": "Erkläre Linux in drei kurzen Sätzen.",
"stream": false
}'So lassen sich Python- und JavaScript-Anwendungen, interne Chatbots, Dokumentenanalyse, RAG-Systeme und Automatisierungen anbinden. Ollama bietet offizielle Bibliotheken für Python und JavaScript.
Wie MCP KI-Systeme mit Werkzeugen und Daten verbindet (Zum Artikel)
Passendes Produkt in meinem Shop
MCP Server Praxisleitfaden 2026
Der Leitfaden vertieft lokale Integrationen, Berechtigungen, Security und kontrollierte Werkzeugverbindungen.
Läuft Ollama wirklich lokal?
Ja, wenn ein lokales Modell verwendet wird. Für einen strikt lokalen Modus lassen sich Cloud-Funktionen deaktivieren:
sudo systemctl edit ollama[Service]
Environment="OLLAMA_NO_CLOUD=1"sudo systemctl daemon-reload
sudo systemctl restart ollamaCloud-Modelle und zugehörige Cloud-Funktionen stehen dann nicht zur Verfügung.
Modellspeicher ändern
Standardmäßig liegen Linux-Modelle unter /usr/share/ollama/.ollama/models. Für ein größeres Laufwerk:
sudo mkdir -p /data/ollama-models
sudo chown -R ollama:ollama /data/ollama-models
sudo systemctl edit ollama[Service]
Environment="OLLAMA_MODELS=/data/ollama-models"sudo systemctl daemon-reload
sudo systemctl restart ollama
Ollama im Netzwerk bereitstellen
Standardmäßig bindet Ollama an 127.0.0.1:11434. Für ein geschütztes internes Netz kann der systemd-Override lauten:
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"Stelle Port 11434 niemals ungeschützt ins Internet. Für die lokale API ist keine Authentifizierung erforderlich. Nutze Firewall, VPN, TLS, Reverse Proxy, Authentifizierung, Zugriffskontrolle und Netzwerksegmentierung. Für einen Einzelplatz ist die Loopback-Vorgabe meist besser.
KI-Ausgaben und Systemrisiken kritisch prüfen (Zum Artikel)
Logs und Updates
journalctl -e -u ollama
journalctl -u ollama -f
sudo systemctl status ollama
curl -fsSL https://ollama.com/install.sh | sh
ollama -v
Manuelle Installation
Wer kein curl | sh einsetzen möchte, kann das offizielle Archiv installieren:
curl -fsSL https://ollama.com/download/ollama-linux-amd64.tar.zst \
| sudo tar x -C /usr
ollama serveFür ARM64 und AMD/ROCm existieren eigene Archive. Auf Servern sollte anschließend ein eigener systemd-Service eingerichtet werden.
Kontextlänge und Speicherbedarf
Eine größere Kontextlänge lässt ein Modell mehr Informationen gleichzeitig berücksichtigen, benötigt aber mehr Speicher. ollama ps zeigt Kontextgröße und Speicherauslagerung des geladenen Modells. Das ist bei großen Dokumenten, Coding-Projekten und Agenten besonders wichtig.
Für wen eignet sich Ollama?
- Privatanwender: einfacher Einstieg in lokale Modelle.
- Entwickler: lokale API für eigene Anwendungen.
- Administratoren: zentraler Dienst in einem geschützten Netz.
- Unternehmen: bewusste Verarbeitung in eigener Infrastruktur.
- Agenten-Entwickler: lokale Modelle für Tools und Workflows.
Ollama oder Cloud-KI?
Cloud-KI punktet bei sehr großen Modellen, Skalierung und geringer lokaler Hardware. Ollama punktet bei Datenkontrolle, Offline-Szenarien, Entwicklung, eigener Infrastruktur, lokaler API und planbaren Hardwarekosten. Häufig ist ein bewusst gewählter Hybridbetrieb sinnvoll.
Fähigkeiten und Grenzen moderner KI-Agenten 2026 (Zum Artikel)
FAQ: Ollama unter Linux
Kann ich Ollama unter Ubuntu oder Debian installieren?
Ja. Ollama stellt offizielle Linux-Pakete für AMD64 und ARM64 bereit.
Benötigt Ollama eine Grafikkarte?
Nein. Modelle laufen auch über die CPU; eine kompatible GPU beschleunigt sie meist deutlich.
Läuft Ollama vollständig lokal?
Lokale Modelle werden lokal ausgeführt. Mit OLLAMA_NO_CLOUD=1 lassen sich Cloud-Funktionen zusätzlich deaktivieren.
Welchen Port verwendet Ollama?
Standardmäßig 11434 an 127.0.0.1.
Hat die lokale Ollama-API eine Authentifizierung?
Für localhost:11434 ist laut Ollama keine Authentifizierung erforderlich. Deshalb darf der Dienst nicht ungeschützt öffentlich erreichbar sein.
Wo befinden sich die Modelle?
Standardmäßig unter /usr/share/ollama/.ollama/models; OLLAMA_MODELS ändert den Pfad.
Fazit
Mit curl -fsSL https://ollama.com/install.sh | sh und ollama run gemma3 wird ein Linux-System in kurzer Zeit zur lokalen KI-Plattform. Die API öffnet den Weg zu eigenen Programmen, Wissensdatenbanken und Automatisierungen; OLLAMA_NO_CLOUD=1 ermöglicht einen gezielten Local-only-Betrieb.
Quellen und Aktualität
Stand des gelieferten Artikels: 9. August 2026; Faktenprüfung und Änderung: 13. August 2026. Verwendet wurden die offiziellen Ollama-Seiten zu Linux-Installation und systemd, CLI, API, GPU-Unterstützung, lokalem Betrieb und Konfiguration sowie Authentifizierung. Das im Ausgangstext genannte, nicht dokumentierte gemma4 wurde auf das aktuell dokumentierte gemma3 korrigiert.