Ollama unter Linux installieren und lokale KI betreiben

KI-Buster Blog · KI / Linux / Lokale LLMs

Ollama unter Linux installieren: KI lokal betreiben

Ollama macht den Betrieb moderner KI-Sprachmodelle auf dem eigenen Linux-System erstaunlich einfach. Wir installieren Ollama, starten das erste lokale Modell, prüfen die GPU und richten bei Bedarf einen Local-only-Betrieb ein.

Veröffentlicht am 9. August 2026 · geprüft und aktualisiert am 13. August 2026

ChatGPT, Gemini oder Claude zeigen, was moderne KI leisten kann. Doch warum muss die KI immer in der Cloud laufen? Mit Ollama können Large Language Models direkt auf einem Linux-PC, einer Workstation oder einem Server ausgeführt werden. Bei lokal ausgeführten Modellen werden Prompts und Antworten laut Ollama nicht an Ollama übertragen; optionale Cloud-Modelle sind getrennt zu betrachten.

Im einfachsten Fall besteht die Installation aus einem Befehl. Diese Anleitung zeigt, wie du Ollama unter Linux installierst, konfigurierst und für deine erste lokale KI verwendest.

Was ist Ollama?

Ollama ist eine Laufzeitumgebung für Large Language Models (LLMs). Sie übernimmt Download und Verwaltung von Modellen, CPU- und GPU-Ausführung, Kommandozeilenbetrieb und eine lokale REST-API. Die aktuelle CLI kann außerdem unterstützte Coding-Werkzeuge und Entwicklungsumgebungen konfigurieren und starten.

Warum KI lokal betreiben?

1. Daten bleiben lokal

Beim lokalen Betrieb verarbeitet das eigene System Eingaben und Antworten. Das ist für internen Code, Dokumente, Wissensdatenbanken, RAG- und Testsysteme interessant. „Lokal“ bedeutet jedoch nicht automatisch DSGVO-konform: Daten, Modelllizenz, Zugriffsschutz und Betriebsprozesse bleiben zu prüfen.

2. Keine Kosten pro lokaler Anfrage

Nach dem Modelldownload fallen keine klassischen API-Kosten pro Token an. Dafür werden eigene CPU-, RAM-, Storage- und eventuell GPU-Ressourcen benötigt.

3. Ohne permanente Cloud-Verbindung

Ein vorhandenes lokales Modell kann grundsätzlich offline laufen. Downloads, Updates und optionale Cloud-Funktionen benötigen weiterhin Internet.

4. Integration in Anwendungen

Ollama stellt standardmäßig eine API unter http://localhost:11434/api bereit.

Voraussetzungen unter Linux

Offizielle Pakete gibt es für AMD64/x86-64 und ARM64. Eine GPU ist nicht zwingend; Modellgröße, Quantisierung und Kontextlänge bestimmen RAM- und VRAM-Bedarf. Starte auf schwächerer Hardware mit einem kleineren Modell.

Schritt 1: Ubuntu oder Debian aktualisieren

sudo apt update
sudo apt upgrade -y
sudo apt install curl -y
uname -m

Typische Architekturausgaben sind x86_64 und aarch64.

Schritt 2: Ollama unter Linux installieren

curl -fsSL https://ollama.com/install.sh | sh
ollama -v

Prüfe heruntergeladene Installationsskripte vor der Ausführung, besonders auf administrierten Systemen. Der Befehl stammt aus der offiziellen Linux-Anleitung.

Schritt 3: Ollama-Dienst prüfen

sudo systemctl status ollama
sudo systemctl start ollama
sudo systemctl enable ollama

Die Startup-Service-Konfiguration wird für systemd-Systeme offiziell empfohlen.

Schritt 4: Erstes lokales Modell starten

ollama run gemma3

Fehlt das Modell, lädt Ollama es zuerst herunter und öffnet danach die interaktive Eingabe. Frage etwa: Erkläre mir Docker in fünf einfachen Sätzen.

Codex CLI als Coding-Agent unter Linux installieren und nutzen (Zum Artikel)

Modelle verwalten

# herunterladen
ollama pull gemma3
# starten
ollama run gemma3
# lokal verfügbare Modelle
ollama ls
# laufende Modelle und CPU/GPU-Nutzung
ollama ps
# entfernen
ollama rm gemma3

Die Befehle sind Teil der offiziellen CLI-Referenz. ollama ps zeigt auch, ob ein Modell auf CPU, GPU oder gemischt geladen ist.

Ollama mit NVIDIA-GPU

Die konkrete Unterstützung hängt unter anderem von GPU-Generation, Compute Capability und Treiber ab. Prüfe den NVIDIA-Treiber mit:

nvidia-smi
ollama ps

100% GPU bedeutet, dass das Modell vollständig im GPU-Speicher liegt. Beachte die aktuelle Ollama-Hardwareliste.

Ollama mit AMD-GPU

Unter Linux verlangt der dokumentierte ROCm-Weg derzeit ROCm v7. Zusätzliche GPU-Unterstützung gibt es über Vulkan. Prüfe vorab die aktuelle Kompatibilitätsliste; für eine manuelle Installation gibt es ein zusätzliches ROCm-Paket.

Ollama ohne GPU

Modelle können vollständig über CPU und Arbeitsspeicher laufen. Das ist langsamer, reicht aber häufig für Tests, kleinere Modelle und einfache Automatisierungen.

Ollama API verwenden

curl http://localhost:11434/api/generate -d '{
  "model": "gemma3",
  "prompt": "Erkläre Linux in drei kurzen Sätzen.",
  "stream": false
}'

So lassen sich Python- und JavaScript-Anwendungen, interne Chatbots, Dokumentenanalyse, RAG-Systeme und Automatisierungen anbinden. Ollama bietet offizielle Bibliotheken für Python und JavaScript.

Wie MCP KI-Systeme mit Werkzeugen und Daten verbindet (Zum Artikel)

Läuft Ollama wirklich lokal?

Ja, wenn ein lokales Modell verwendet wird. Für einen strikt lokalen Modus lassen sich Cloud-Funktionen deaktivieren:

sudo systemctl edit ollama
[Service]
Environment="OLLAMA_NO_CLOUD=1"
sudo systemctl daemon-reload
sudo systemctl restart ollama

Cloud-Modelle und zugehörige Cloud-Funktionen stehen dann nicht zur Verfügung.

Modellspeicher ändern

Standardmäßig liegen Linux-Modelle unter /usr/share/ollama/.ollama/models. Für ein größeres Laufwerk:

sudo mkdir -p /data/ollama-models
sudo chown -R ollama:ollama /data/ollama-models
sudo systemctl edit ollama
[Service]
Environment="OLLAMA_MODELS=/data/ollama-models"
sudo systemctl daemon-reload
sudo systemctl restart ollama

Ollama im Netzwerk bereitstellen

Standardmäßig bindet Ollama an 127.0.0.1:11434. Für ein geschütztes internes Netz kann der systemd-Override lauten:

[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"

Stelle Port 11434 niemals ungeschützt ins Internet. Für die lokale API ist keine Authentifizierung erforderlich. Nutze Firewall, VPN, TLS, Reverse Proxy, Authentifizierung, Zugriffskontrolle und Netzwerksegmentierung. Für einen Einzelplatz ist die Loopback-Vorgabe meist besser.

KI-Ausgaben und Systemrisiken kritisch prüfen (Zum Artikel)

Logs und Updates

journalctl -e -u ollama
journalctl -u ollama -f
sudo systemctl status ollama
curl -fsSL https://ollama.com/install.sh | sh
ollama -v

Manuelle Installation

Wer kein curl | sh einsetzen möchte, kann das offizielle Archiv installieren:

curl -fsSL https://ollama.com/download/ollama-linux-amd64.tar.zst \
  | sudo tar x -C /usr
ollama serve

Für ARM64 und AMD/ROCm existieren eigene Archive. Auf Servern sollte anschließend ein eigener systemd-Service eingerichtet werden.

Kontextlänge und Speicherbedarf

Eine größere Kontextlänge lässt ein Modell mehr Informationen gleichzeitig berücksichtigen, benötigt aber mehr Speicher. ollama ps zeigt Kontextgröße und Speicherauslagerung des geladenen Modells. Das ist bei großen Dokumenten, Coding-Projekten und Agenten besonders wichtig.

Für wen eignet sich Ollama?

  • Privatanwender: einfacher Einstieg in lokale Modelle.
  • Entwickler: lokale API für eigene Anwendungen.
  • Administratoren: zentraler Dienst in einem geschützten Netz.
  • Unternehmen: bewusste Verarbeitung in eigener Infrastruktur.
  • Agenten-Entwickler: lokale Modelle für Tools und Workflows.

Ollama oder Cloud-KI?

Cloud-KI punktet bei sehr großen Modellen, Skalierung und geringer lokaler Hardware. Ollama punktet bei Datenkontrolle, Offline-Szenarien, Entwicklung, eigener Infrastruktur, lokaler API und planbaren Hardwarekosten. Häufig ist ein bewusst gewählter Hybridbetrieb sinnvoll.

Fähigkeiten und Grenzen moderner KI-Agenten 2026 (Zum Artikel)

FAQ: Ollama unter Linux

Kann ich Ollama unter Ubuntu oder Debian installieren?

Ja. Ollama stellt offizielle Linux-Pakete für AMD64 und ARM64 bereit.

Benötigt Ollama eine Grafikkarte?

Nein. Modelle laufen auch über die CPU; eine kompatible GPU beschleunigt sie meist deutlich.

Läuft Ollama vollständig lokal?

Lokale Modelle werden lokal ausgeführt. Mit OLLAMA_NO_CLOUD=1 lassen sich Cloud-Funktionen zusätzlich deaktivieren.

Welchen Port verwendet Ollama?

Standardmäßig 11434 an 127.0.0.1.

Hat die lokale Ollama-API eine Authentifizierung?

Für localhost:11434 ist laut Ollama keine Authentifizierung erforderlich. Deshalb darf der Dienst nicht ungeschützt öffentlich erreichbar sein.

Wo befinden sich die Modelle?

Standardmäßig unter /usr/share/ollama/.ollama/models; OLLAMA_MODELS ändert den Pfad.

Fazit

Mit curl -fsSL https://ollama.com/install.sh | sh und ollama run gemma3 wird ein Linux-System in kurzer Zeit zur lokalen KI-Plattform. Die API öffnet den Weg zu eigenen Programmen, Wissensdatenbanken und Automatisierungen; OLLAMA_NO_CLOUD=1 ermöglicht einen gezielten Local-only-Betrieb.

Quellen und Aktualität

Stand des gelieferten Artikels: 9. August 2026; Faktenprüfung und Änderung: 13. August 2026. Verwendet wurden die offiziellen Ollama-Seiten zu Linux-Installation und systemd, CLI, API, GPU-Unterstützung, lokalem Betrieb und Konfiguration sowie Authentifizierung. Das im Ausgangstext genannte, nicht dokumentierte gemma4 wurde auf das aktuell dokumentierte gemma3 korrigiert.