Lokale KI in 20 Minuten: Ollama und Open WebUI per Docker – dein eigener ChatGPT-Ersatz ohne Cloud

Ein Sprachmodell, das Fragen beantwortet, Texte zusammenfasst und Code erklärt – und dabei kein Wort nach außen schickt. Mit Ollama (Modell-Server) und Open WebUI (Chat-Oberfläche) ist das in zwei Docker-Befehlen erledigt. Diese Anleitung nutzt ausschließlich die Kommandos aus den offiziellen Dokumentationen, damit nichts an einer veralteten Option scheitert. Läuft auf Windows (mit Docker Desktop), Linux, macOS, Mini-PCs und den meisten NAS mit Docker.
Auf einen Blick
Dauer: ca. 30 Min. · Schwierigkeit: Einsteiger · Kosten: siehe Materialliste (Preise bei Amazon prüfen)
📦 Material (ohne Preisangaben – bitte bei Amazon prüfen)
- Rechner mit DockerDocker Desktop (Windows/macOS) oder Docker Engine (Linux); NAS mit Container-Station/Container Manager
- Arbeitsspeichermindestens 8 GB für Modelle mit rund 3 Milliarden Parametern, 16 GB für 7–8 B
- Optional: GrafikkarteNVIDIA mit Container Toolkit oder AMD mit ROCm – beschleunigt deutlich, ist aber nicht Pflicht
- Freier Speicherplatz5–10 GB je Modell
- Optional: Mini-PC als Dauerläufer (Werbung)ein sparsamer Mini-PC mit 32 GB RAM ist eine gute lokale KI-Basis
Schritt für Schritt
Ollama-Container starten
Nur CPU (funktioniert überall):
docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
Mit NVIDIA-Grafikkarte zuerst das NVIDIA Container Toolkit installieren, Docker konfigurieren und dann starten:
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker
docker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
Mit AMD-Grafikkarte (ROCm) das spezielle Image verwenden:
docker run -d --device /dev/kfd --device /dev/dri -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama:rocm
Das Volume ollama speichert die Modelle dauerhaft; Port 11434 ist die Ollama-API.
Erstes Modell laden und testen
docker exec -it ollama ollama run llama3.2
Ollama lädt das Modell beim ersten Aufruf herunter und öffnet danach einen Chat im Terminal. Mit /bye
beendest du ihn. Weitere Modelle findest du in der Ollama-Bibliothek; für deutschsprachige Aufgaben sind Modelle
der Qwen- und Gemma-Familien beliebt. Faustregel: Ein Modell mit 8 Milliarden Parametern braucht rund 5 GB RAM
oder VRAM, mit 3 Milliarden etwa 2 GB.
Open WebUI starten
Die Oberfläche läuft als zweiter Container und verbindet sich mit Ollama auf demselben Rechner:
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main
Wer alles in einem Container möchte, nimmt das gebündelte Image (enthält Ollama gleich mit; CPU-Variante):
docker run -d -p 3000:8080 -v ollama:/root/.ollama -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:ollama
Für GPU-Systeme ergänzt man --gpus=all. Die Doku empfiehlt zusätzlich einen festen Schlüssel per
-e WEBUI_SECRET_KEY=… (erzeugen mit openssl rand -hex 32), damit Anmeldungen einen Neustart überleben.
Anmelden und Modell wählen
Öffne http://localhost:3000 (vom NAS aus: dessen IP-Adresse). Beim ersten Aufruf legst du ein
Administratorkonto an – es liegt nur lokal in der Datenbank des Containers. Oben links wählst du das
Modell; fehlt eines, kannst du es in Admin → Einstellungen → Modelle direkt aus der Oberfläche laden.
Dokumente einbinden (RAG)
Über das Büroklammer-Symbol im Chat lädst du PDFs oder Textdateien hoch; Open WebUI zerlegt sie und lässt das Modell darauf antworten. Unter Workspace → Knowledge legst du dauerhafte Sammlungen an – etwa deine Bedienungsanleitungen oder Notizen. Nichts davon verlässt den Rechner.
Zugriff aus dem Heimnetz und Updates
Andere Geräte erreichen die Oberfläche über http://<IP-des-Rechners>:3000. Öffne den Port
nicht im Router nach außen – wer von unterwegs zugreifen will, nutzt ein VPN (z. B. WireGuard auf der FRITZ!Box).
Updates: Container stoppen, Image neu ziehen, Container mit demselben Befehl neu anlegen; die Volumes bleiben erhalten.
docker pull ollama/ollama
docker pull ghcr.io/open-webui/open-webui:main
Was realistisch ist – und was nicht
Auf einer reinen CPU antworten 3-B-Modelle flüssig, 8-B-Modelle gemächlich, alles darüber wird zäh. Eine Grafikkarte mit 8 GB VRAM macht 8-B-Modelle schnell; 12–16 GB reichen für 14-B-Modelle. Die großen Cloud-Modelle, die wir in unserem September-Überblick beschreiben, erreicht man lokal nicht – für Zusammenfassungen, Übersetzungen, Code-Hilfe und Fragen zu eigenen Dokumenten sind die offenen Modelle aber längst gut genug. Wer Ollama lieber auf dem NAS betreibt, findet Hinweise in Ollama auf Synology und QNAP; für den Raspberry Pi 5 zeigt unsere Llama-Anleitung die Grenzen.
Häufige Fragen
Brauche ich eine Grafikkarte?
Nein. Ollama läuft auf der CPU; kleine Modelle (3 B) sind dann noch flüssig, größere langsam. Eine GPU beschleunigt um ein Vielfaches.
Wo liegen meine Daten?
Modelle im Docker-Volume „ollama“, Chats und Konten im Volume „open-webui“ – beides nur auf deinem Rechner.
Läuft das unter Windows?
Ja, mit Docker Desktop (WSL2). Alternativ gibt es Ollama auch als nativen Windows-Installer; Open WebUI verbindet sich dann mit http://host.docker.internal:11434.
Quellen
- Ollama: Docker-Dokumentation (CPU, NVIDIA, AMD, ollama run)
- Open WebUI: Quick Start (docker run, Ports, Volumes, Secret Key)
- Ollama: Modellbibliothek
Transparenz: Dieser Beitrag wurde mit KI-Unterstützung recherchiert und verfasst und redaktionell geprüft (Kennzeichnung nach Art. 50 KI-VO). Alle Angaben stammen aus den genannten Quellen, Stand 24. September 2026. Links zu Amazon sind Affiliate-Links (Werbung).