Ollama selbst hosten: 10 bis 20 € im Monat
Ollama auf eigenem Server: 10 bis 20 € im Monat auf dem VPS, egal wie viele Nutzer. Welche Hardware welches Modell trägt, plus DSGVO im Klartext.

Passend zum Thema: In zwei Minuten einordnen, welche Pflichten aus der KI-Verordnung Ihren Betrieb treffen.
Zum KI-Verordnungs-SchnellcheckChatGPT, Claude und Co. liefern beeindruckende Ergebnisse, aber viele Unternehmen können oder wollen ihre Daten nicht an US-Cloud-Dienste übergeben. Die Alternative: KI-Modelle selbst betreiben, auf eigener Hardware, ohne Datenabfluss. Was vor zwei Jahren noch Expertenwissen erforderte, ist 2026 in wenigen Minuten eingerichtet.
Dieser Artikel zeigt Ihnen den kompletten Stack, vergleicht die verfügbaren Modelle und erklärt, was Sie an Hardware brauchen.
Sie suchen nur eine Zahl? Was der Betrieb kostet und wann sich das gegenüber ChatGPT Plus rechnet, steht kompakt auf KI selbst hosten: Kosten und Ablauf.
Noch grundsätzlicher unterwegs? Der Anker-Artikel Lokale KI im Unternehmen vergleicht die drei Betriebsarten, nennt die nötige Hardware und sagt, wann sich das Ganze ausdrücklich NICHT lohnt. Wer zwischen den Werkzeugen schwankt: Ollama vs LM Studio. Welche Hardware Sie für welches Modell brauchen, mit gerechnetem Speicherbedarf und aktuellen Marktpreisen, steht auf Ollama-Hardware und Server mieten. Wenn Sie den Weg dorthin verstehen wollen, lesen Sie einfach weiter.
Der Stack: Drei Bausteine
Eine Self-Hosted-KI-Lösung für Unternehmen besteht aus drei Komponenten:
1. Ollama: der Inference-Server
Ollama ist ein Open-Source-Tool, das KI-Sprachmodelle auf lokaler Hardware ausführt. Es lädt Modelle herunter, verwaltet sie und stellt eine API bereit, kompatibel zum OpenAI-Format. Die Installation erfolgt über Docker oder als native Anwendung.
2. Open WebUI: die Benutzeroberfläche
Open WebUI ist eine browserbasierte Chat-Oberfläche, die sich direkt mit Ollama verbindet. Für Ihre Mitarbeiter fühlt es sich an wie ChatGPT, mit dem Unterschied, dass alles auf Ihrem eigenen Server läuft.
Wichtige Features für den Unternehmenseinsatz:
- Benutzerkonten mit Rollen (Admin, User)
- Chat-Historien pro Nutzer (privat)
- Vorlagen für häufige Aufgaben (System-Prompts)
- Eingebaute RAG-Funktion: Firmendokumente hochladen und durchsuchen
- Modellauswahl: Nutzer können zwischen verschiedenen Modellen wechseln
3. n8n: die Automation (optional)
Für automatisierte Workflows können Sie n8n einsetzen. Typische KI-Automationen:
- Eingehende E-Mails zusammenfassen und Antwortvorschläge generieren
- Angebote aus Stichpunkten erstellen
- Support-Tickets kategorisieren und priorisieren
- Dokumente automatisch zusammenfassen und verschlagworten
n8n verbindet sich über die Ollama-API mit Ihren lokalen Modellen, die Daten bleiben dabei im internen Netzwerk.
Modellvergleich: Welches Modell für welchen Zweck?
Open-Source-Modelle haben in den letzten zwei Jahren enorme Fortschritte gemacht. Hier die wichtigsten Optionen:
Stand der Modell-Angaben: August 2026. Modellnamen sind das Verfallsdatum jedes KI-Artikels. Die Werte unten sind Richtwerte bei 4-Bit-Quantisierung und schwanken mit der Kontextlänge. Wenn Sie diesen Abschnitt deutlich später lesen: Die Klassen und die Auswahl-Logik bleiben gültig, die konkreten Namen prüfen Sie besser gegen die aktuelle Ollama-Bibliothek.
Der wichtigste Punkt zuerst: Deutsch braucht Größe
Unter etwa 7 Milliarden Parametern bricht die deutsche Sprachqualität ein. Sie sehen Grammatikfehler und Modelle, die mitten im Satz ins Englische wechseln. Die ganz kleinen Modelle sind bei der Hardware verlockend, aber für deutschen Schriftverkehr im Betrieb ist die 8B-Klasse die untere Grenze. Wer Angebote und Kundenmails schreiben lässt, ist mit der 27B-Klasse deutlich besser bedient.
Einstiegsklasse (läuft auf bescheidener Hardware)
| Modell | Speicherbedarf | Stärke | Deutsch |
|---|---|---|---|
| Qwen3 8B | ca. 6 GB | Allrounder für Text und Anweisungen | Gut |
| Mistral Small | ca. 14 GB | Solide Textarbeit, europäisches Modell | Gut |
| Gemma 4 (kleine Variante) | ab ca. 7 GB | Kompakt, versteht auch Bilder | Brauchbar |
Geeignet für: E-Mails beantworten, Texte zusammenfassen, Angebote formulieren, einfache Fragen. Für viele Büroaufgaben ausreichend.
Arbeitsklasse (hier tragen lokale Modelle im Alltag wirklich)
| Modell | Speicherbedarf | Stärke | Deutsch |
|---|---|---|---|
| Qwen3 27B | ca. 16 GB | Beste Qualität je Gigabyte, passt auf eine 24-GB-Karte | Sehr gut |
| Qwen3 Coder 30B | ca. 19 GB | Code und lange Dokumente (großes Kontextfenster) | Gut |
| DeepSeek R1 (destilliert, 14B bis 32B) | ca. 9 bis 20 GB | Schrittweises Denken, Analyse | Gut |
| Llama 3.3 70B | ca. 43 GB | Arbeitstier für anspruchsvolle Texte | Sehr gut |
Geeignet für: Komplexe Analysen, längere Dokumente, anspruchsvolle Texterstellung. Braucht deutlich mehr Speicher und läuft auf kleinen Servern ohne GPU langsam.
Empfehlung für den Einstieg
Starten Sie mit Qwen3 8B. Das Modell läuft auf bescheidener Hardware und reicht für den Geschäftsalltag. Wenn deutsche Texte in Kundenqualität herauskommen sollen, planen Sie die 27B-Klasse ein: Der Sprung in der Sprachqualität ist größer als der Sprung im Hardware-Preis. Wechseln können Sie jederzeit, die Modelle sind austauschbar, das ist der Vorteil offener Gewichte.
Installation: In fünf Schritten zum laufenden System
Die Einrichtung zum Ausprobieren dauert auf einem normalen Büro-Rechner etwa 15 Minuten. Für den Team-Betrieb auf einem Server kommen Benutzerverwaltung und Absicherung dazu, der Weg ist aber derselbe.
Schritt 1: Ollama installieren
Den Installer für Windows, macOS und Linux gibt es direkt beim Projekt: ollama.com/download. Unter Linux (auch auf dem Mietserver) genügt eine Zeile im Terminal:
curl -fsSL https://ollama.com/install.sh | sh
Danach läuft Ollama als Dienst im Hintergrund und wartet auf Anfragen.
Schritt 2: Das erste Modell laden
ollama run qwen3:8b
Beim ersten Aufruf lädt Ollama das Modell herunter (bei Qwen3 8B rund 5 GB, je nach Leitung ein paar Minuten) und startet direkt einen Chat im Terminal. Welche Modelle es gibt und wie groß sie sind, listet die Ollama-Bibliothek.
Schritt 3: Open WebUI als Oberfläche für das Team
Das Terminal ist nichts für den Büroalltag. Open WebUI liefert die vertraute Chat-Oberfläche und läuft am einfachsten als Docker-Container:
docker run -d -p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
--name open-webui --restart always \
ghcr.io/open-webui/open-webui:main
Danach ist die Oberfläche unter http://localhost:3000 erreichbar, das erste angelegte Konto wird automatisch Administrator. Mitarbeiter melden sich mit eigenen Konten an, Gespräche bleiben getrennt.
Schritt 4: Modelle von Hugging Face nachladen
Die Ollama-Bibliothek deckt die gängigen Modelle ab. Das vollständige Angebot an offenen Gewichten liegt auf Hugging Face, dort finden Sie auch spezialisierte deutsche Feinabstimmungen, die es in der Ollama-Bibliothek nicht gibt. Ollama kann GGUF-Dateien von dort direkt beziehen:
ollama run hf.co/BENUTZER/MODELLNAME-GGUF:Q4_K_M
Zwei Dinge beachten: Das Modell muss im GGUF-Format vorliegen (auf Hugging Face links nach „GGUF“ filtern), und die Endung wählt die Quantisierung. Q4_K_M ist der übliche Kompromiss aus Qualität und Speicherbedarf, feiner quantisierte Varianten wie Q8_0 brauchen fast doppelt so viel Speicher für einen Qualitätsgewinn, den man im Büroalltag selten merkt.
Schritt 5: Modelle austauschen, wenn ein besseres erscheint
Der eigentliche Vorteil des Selbst-Betriebs: Ein Modellwechsel ist kein Projekt, sondern drei Befehle.
ollama pull qwen3:27b # neues Modell laden
ollama list # was liegt auf der Platte?
ollama rm qwen3:8b # altes Modell entfernen, gibt Speicher frei
In Open WebUI taucht das neue Modell automatisch in der Auswahl auf; unter Einstellungen legen Sie es als Standard für alle Nutzer fest. Ihre Gespräche, Nutzerkonten und hochgeladenen Dokumente bleiben dabei unangetastet, die Oberfläche und das Modell sind sauber getrennt. Prüfen Sie nach jedem Wechsel mit zwei, drei typischen Aufgaben aus Ihrem Alltag, ob das neue Modell die alten wirklich schlägt, bevor Sie das alte löschen.
Lieber einrichten lassen? Genau diese Schritte, plus Absicherung, Benutzerverwaltung, DSGVO-Dokumentation und Mitarbeitereinweisung, übernehmen wir als Festpreis-Paket: auf einem deutschen Mietserver oder als eigener KI-Server im Betrieb. Was beides kostet, steht offen auf KI selbst hosten.
Hardware-Anforderungen
Eine ausführliche Aufstellung mit dem gerechneten Speicherbedarf je Modellklasse, den drei Betriebsvarianten und aktuellen Marktpreisen steht auf der Seite Ollama-Hardware: Anforderungen und Server mieten. Hier die Kurzfassung:
Variante 1: VPS (Virtual Private Server)
Ein gemieteter Server bei einem deutschen Anbieter (z.B. Hetzner, Netcup, Dogado):
- Minimum: 8 GB RAM, 4 vCPUs → reicht für 7B-Modelle
- Empfohlen: 16 GB RAM, 8 vCPUs → komfortabel für 7-8B-Modelle
- Kosten: ab ca. 10-20 Euro pro Monat
- Vorteil: Kein eigener Serverraum nötig, Daten bleiben in Deutschland
Variante 2: NAS oder Homeserver
Ein leistungsfähiges NAS (Synology, QNAP) oder ein Mini-PC im Büro:
- Minimum: 16 GB RAM, moderner x86-Prozessor
- Vorteil: Daten verlassen nie das Büronetzwerk, einmalige Kosten
- Nachteil: Sie sind für Wartung und Backup selbst verantwortlich
Variante 3: Dedizierter Server mit GPU
Für höchste Anforderungen (70B-Modelle, viele gleichzeitige Nutzer):
- Empfohlen: NVIDIA RTX 4090 (24 GB VRAM) oder A6000 (48 GB VRAM)
- Kosten: Hetzner GPU-Server ab ca. 150 Euro pro Monat
- Vorteil: Antwortzeiten wie bei ChatGPT, auch bei großen Modellen
CPU vs. GPU
Wichtig zu wissen: Ollama läuft auch ohne GPU, dann rechnet der Prozessor. Bei 7B-Modellen ist das akzeptabel (Antwort in 5-15 Sekunden), bei 70B-Modellen wird es langsam (30-60 Sekunden pro Antwort). Eine GPU beschleunigt die Inferenz um den Faktor 5-10.
RAG: Firmenwissen durchsuchbar machen
Die vielleicht spannendste Funktion für Unternehmen: RAG (Retrieval-Augmented Generation). Damit kann das KI-Modell auf Ihre internen Dokumente zugreifen und Fragen dazu beantworten.
So funktioniert es in Open WebUI
- Dokumente hochladen: PDF, DOCX, TXT oder Markdown in Open WebUI hochladen
- Automatische Verarbeitung: Das System zerlegt die Dokumente in Textabschnitte und erstellt einen Suchindex
- Fragen stellen: Wenn Sie eine Frage stellen, durchsucht das System zuerst Ihre Dokumente und gibt dem Modell die relevanten Stellen als Kontext mit
- Fundierte Antwort: Das Modell antwortet auf Basis Ihrer tatsächlichen Firmendaten, statt zu raten
Praxisbeispiele
- Mitarbeiterhandbuch: “Wie viele Urlaubstage habe ich nach der Probezeit?” → Antwort aus dem Handbuch
- Produktkatalog: “Welche unserer Maschinen eignet sich für Aluminium bis 5mm?” → Antwort aus dem Katalog
- Vertragstexte: “Was sind die Kündigungsfristen im Rahmenvertrag mit Lieferant X?” → Antwort aus dem Vertrag
Datenschutz bei RAG
Bei Self-Hosted RAG bleiben alle Dokumente und der Suchindex auf Ihrem Server. Es werden keine Daten an externe Dienste übermittelt. Die Dokumente werden nicht zum Training des Modells verwendet, sie dienen ausschließlich als Kontextinformation bei Anfragen.
Self-Hosted vs. ChatGPT Plus: Der Vergleich
| Kriterium | Self-Hosted (Ollama) | ChatGPT Plus/Team |
|---|---|---|
| Datenschutz | Maximal: Daten bleiben lokal | AVV nötig, Daten bei OpenAI |
| Modellqualität | Gut (7B) bis sehr gut (70B) | Beste verfügbare (GPT-4o) |
| Kosten | ab 10 Euro/Monat (VPS) | 25-30 Dollar/Nutzer/Monat |
| Skalierung | Unbegrenzte Nutzer, eine Lizenz | Pro Nutzer bezahlen |
| Firmenwissen (RAG) | Eingebaut (Open WebUI) | Nur mit Enterprise-Plan |
| Automatisierung | Volle API-Kontrolle (n8n) | Eingeschränkt (GPTs) |
| Internetanbindung | Nicht nötig (auch offline) | Zwingend erforderlich |
| Einrichtung | Technisches Know-how nötig | Sofort nutzbar |
Fazit: Für ein Team mit 5 Mitarbeitern kostet ChatGPT Team 125-150 Dollar pro Monat, ohne RAG, ohne Automatisierung, mit Datenschutz-Bedenken. Eine Self-Hosted-Lösung auf einem VPS kostet 10-20 Euro pro Monat, unabhängig von der Nutzerzahl, mit voller DSGVO-Konformität.
Häufige Fragen
Wie lange dauert die Einrichtung?
Ollama + Open WebUI über Docker: ca. 30 Minuten für einen erfahrenen IT-Dienstleister. Modelle herunterladen: je nach Modellgröße und Internetverbindung 5-30 Minuten.
Können meine Mitarbeiter das bedienen?
Ja. Open WebUI sieht aus und funktioniert wie ChatGPT. Wer ChatGPT bedienen kann, kann auch Open WebUI bedienen. Eine kurze Einführung (30-60 Minuten) reicht in der Regel aus.
Was passiert bei einem Serverausfall?
Wie bei jeder IT-Infrastruktur: Regelmäßige Backups sind Pflicht. Bei einem VPS übernimmt der Hoster die Hardware-Verfügbarkeit. Die Chat-Historien und hochgeladenen Dokumente sollten regelmäßig gesichert werden.
Kann ich später auf Cloud-KI wechseln?
Ja, problemlos. Open WebUI kann neben Ollama auch externe APIs anbinden (OpenAI, Anthropic). Sie können den Hybrid-Ansatz nutzen: Standard-Aufgaben lokal, anspruchsvolle Aufgaben über Cloud-API, alles über dieselbe Oberfläche.
Brauche ich dafür einen IT-Dienstleister?
Nicht zwingend, aber empfehlenswert. Die Ersteinrichtung ist mit Docker-Kenntnissen machbar, aber für den sicheren Betrieb (HTTPS, Backup, Monitoring, Updates) ist Fachwissen hilfreich.
Nächster Schritt
Sie möchten Self-Hosted KI in Ihrem Unternehmen einsetzen? Auf der Seite KI selbst hosten stehen die Kosten für Betrieb und Einrichtung getrennt aufgeschlüsselt, dazu die ehrliche Einordnung, für wen sich das rechnet und für wen nicht. Wenn es um einen eigenen KI-Server im Betrieb geht, mit Hardware-Empfehlung, Einrichtung und laufendem Betrieb aus einer Hand, finden Sie die Pakete auf der Seite On-Premise KI.
Mit dem KI-Kickstart richten wir Ollama und Open WebUI an einem Tag für Sie ein, inklusive DSGVO-Dokumentation, Mitarbeiterschulung und 14 Tagen Support.
KI im eigenen Unternehmen einsetzen?
Multi-Provider-KI mit Claude, Gemini, ChatGPT und n8n: DSGVO-konform und pragmatisch. Im Erstgespräch klären wir, was sich für Sie rechnet.
Das könnte Sie auch interessieren
Lokale KI im Unternehmen: Was sie leistet, was sie kostet, wann sie sich nicht lohnt
Lokale KI heißt: das Sprachmodell läuft auf Ihrer Hardware oder auf einem deutschen Server. Welche Modelle es tragen, welche Hardware nötig ist, was es kostet und für wen sich das ausdrücklich nicht rechnet.
EU AI Act 2026: Was KMU jetzt tun müssen: Risiko-Klassen + Pflichten-Check
Die KI-Verordnung gilt: Transparenzpflichten seit August 2026, KI-Kompetenz seit 2025, Hochrisiko auf Ende 2027 verschoben. Was KMU konkret tun müssen.
KI DSGVO-konform im Unternehmen einsetzen: Der komplette Leitfaden
KI im Unternehmen einführen und DSGVO-konform bleiben: Self-Hosted vs. EU-Cloud, rechtliche Pflichten, technische Maßnahmen und praktische Checkliste.