DIY 24. September 2026 · 9 Min. Lesezeit

Lokale KI in 20 Minuten: Ollama und Open WebUI per Docker – dein eigener ChatGPT-Ersatz ohne Cloud

Lokale KI in 20 Minuten: Ollama und Open WebUI per Docker – dein eigener ChatGPT-Ersatz ohne Cloud – Titelgrafik MMOFinds

Ein Sprachmodell, das Fragen beantwortet, Texte zusammenfasst und Code erklärt – und dabei kein Wort nach außen schickt. Mit Ollama (Modell-Server) und Open WebUI (Chat-Oberfläche) ist das in zwei Docker-Befehlen erledigt. Diese Anleitung nutzt ausschließlich die Kommandos aus den offiziellen Dokumentationen, damit nichts an einer veralteten Option scheitert. Läuft auf Windows (mit Docker Desktop), Linux, macOS, Mini-PCs und den meisten NAS mit Docker.

Auf einen Blick

Dauer: ca. 30 Min. · Schwierigkeit: Einsteiger · Kosten: siehe Materialliste (Preise bei Amazon prüfen)

📦 Material (ohne Preisangaben – bitte bei Amazon prüfen)

  • Rechner mit DockerDocker Desktop (Windows/macOS) oder Docker Engine (Linux); NAS mit Container-Station/Container Manager
  • Arbeitsspeichermindestens 8 GB für Modelle mit rund 3 Milliarden Parametern, 16 GB für 7–8 B
  • Optional: GrafikkarteNVIDIA mit Container Toolkit oder AMD mit ROCm – beschleunigt deutlich, ist aber nicht Pflicht
  • Freier Speicherplatz5–10 GB je Modell
  • Optional: Mini-PC als Dauerläufer (Werbung)ein sparsamer Mini-PC mit 32 GB RAM ist eine gute lokale KI-Basis

Schritt für Schritt

1

Ollama-Container starten

Nur CPU (funktioniert überall):

docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama

Mit NVIDIA-Grafikkarte zuerst das NVIDIA Container Toolkit installieren, Docker konfigurieren und dann starten:

sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker
docker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama

Mit AMD-Grafikkarte (ROCm) das spezielle Image verwenden:

docker run -d --device /dev/kfd --device /dev/dri -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama:rocm

Das Volume ollama speichert die Modelle dauerhaft; Port 11434 ist die Ollama-API.

2

Erstes Modell laden und testen

docker exec -it ollama ollama run llama3.2

Ollama lädt das Modell beim ersten Aufruf herunter und öffnet danach einen Chat im Terminal. Mit /bye beendest du ihn. Weitere Modelle findest du in der Ollama-Bibliothek; für deutschsprachige Aufgaben sind Modelle der Qwen- und Gemma-Familien beliebt. Faustregel: Ein Modell mit 8 Milliarden Parametern braucht rund 5 GB RAM oder VRAM, mit 3 Milliarden etwa 2 GB.

3

Open WebUI starten

Die Oberfläche läuft als zweiter Container und verbindet sich mit Ollama auf demselben Rechner:

docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main

Wer alles in einem Container möchte, nimmt das gebündelte Image (enthält Ollama gleich mit; CPU-Variante):

docker run -d -p 3000:8080 -v ollama:/root/.ollama -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:ollama

Für GPU-Systeme ergänzt man --gpus=all. Die Doku empfiehlt zusätzlich einen festen Schlüssel per -e WEBUI_SECRET_KEY=… (erzeugen mit openssl rand -hex 32), damit Anmeldungen einen Neustart überleben.

4

Anmelden und Modell wählen

Öffne http://localhost:3000 (vom NAS aus: dessen IP-Adresse). Beim ersten Aufruf legst du ein Administratorkonto an – es liegt nur lokal in der Datenbank des Containers. Oben links wählst du das Modell; fehlt eines, kannst du es in Admin → Einstellungen → Modelle direkt aus der Oberfläche laden.

5

Dokumente einbinden (RAG)

Über das Büroklammer-Symbol im Chat lädst du PDFs oder Textdateien hoch; Open WebUI zerlegt sie und lässt das Modell darauf antworten. Unter Workspace → Knowledge legst du dauerhafte Sammlungen an – etwa deine Bedienungsanleitungen oder Notizen. Nichts davon verlässt den Rechner.

6

Zugriff aus dem Heimnetz und Updates

Andere Geräte erreichen die Oberfläche über http://<IP-des-Rechners>:3000. Öffne den Port nicht im Router nach außen – wer von unterwegs zugreifen will, nutzt ein VPN (z. B. WireGuard auf der FRITZ!Box). Updates: Container stoppen, Image neu ziehen, Container mit demselben Befehl neu anlegen; die Volumes bleiben erhalten.

docker pull ollama/ollama
docker pull ghcr.io/open-webui/open-webui:main

Was realistisch ist – und was nicht

Auf einer reinen CPU antworten 3-B-Modelle flüssig, 8-B-Modelle gemächlich, alles darüber wird zäh. Eine Grafikkarte mit 8 GB VRAM macht 8-B-Modelle schnell; 12–16 GB reichen für 14-B-Modelle. Die großen Cloud-Modelle, die wir in unserem September-Überblick beschreiben, erreicht man lokal nicht – für Zusammenfassungen, Übersetzungen, Code-Hilfe und Fragen zu eigenen Dokumenten sind die offenen Modelle aber längst gut genug. Wer Ollama lieber auf dem NAS betreibt, findet Hinweise in Ollama auf Synology und QNAP; für den Raspberry Pi 5 zeigt unsere Llama-Anleitung die Grenzen.

Häufige Fragen

Brauche ich eine Grafikkarte?

Nein. Ollama läuft auf der CPU; kleine Modelle (3 B) sind dann noch flüssig, größere langsam. Eine GPU beschleunigt um ein Vielfaches.

Wo liegen meine Daten?

Modelle im Docker-Volume „ollama“, Chats und Konten im Volume „open-webui“ – beides nur auf deinem Rechner.

Läuft das unter Windows?

Ja, mit Docker Desktop (WSL2). Alternativ gibt es Ollama auch als nativen Windows-Installer; Open WebUI verbindet sich dann mit http://host.docker.internal:11434.

Quellen

Transparenz: Dieser Beitrag wurde mit KI-Unterstützung recherchiert und verfasst und redaktionell geprüft (Kennzeichnung nach Art. 50 KI-VO). Alle Angaben stammen aus den genannten Quellen, Stand 24. September 2026. Links zu Amazon sind Affiliate-Links (Werbung).