KI Schulung für Mitarbeiter ohne Vorkenntnisse: ein Tag inhouse mit Live Demo und Live Coding, am Ende steht ein eigenes Tool für eure Abteilung
Mehr erfahren
Ollama ist eine Open Source Plattform, mit der Entwickler große Sprachmodelle (LLMs) lokal auf dem eigenen Rechner ausführen können, ohne Cloud, ohne API Schlüssel und ohne Daten an Dritte zu senden. Seit dem Launch 2023 hat sich Ollama zum meistgenutzten lokalen LLM Runner entwickelt und unterstützt mittlerweile über 150 Modelle aus der hauseigenen Bibliothek.
Der Kern von Ollama ist einfach: Ein einziger Befehl wie ollama run llama3.2 lädt ein KI-Modell herunter und startet eine interaktive Chat Session im Terminal. Was Ollama 2026 besonders spannend macht, sind die brandneuen Features: Subagenten für parallele Aufgabenausführung und eine integrierte Websuche, die ohne MCP Server oder zusätzliche Konfiguration funktioniert.
Für Unternehmen in der EU ist Ollama besonders relevant: Wer KI-Modelle lokal betreibt, behält die volle Kontrolle über sensible Daten, ein entscheidender Vorteil in Zeiten von DSGVO und Compliance und wachsenden Anforderungen. Gleichzeitig entfallen laufende API Kosten, was Ollama für Teams jeder Größe attraktiv macht.
Bei Never Code Alone läuft Ollama nicht nur im Testlabor, sondern täglich im eigenen Stack: lokale Modelle wie Qwen und Llama betreiben wir produktiv für KI-gestütztes Content Marketing und Vibe Coding. Aus dieser Praxis kennen wir die Stolpersteine beim Wechsel von der Cloud auf eine eigene, DSGVO konforme KI-Infrastruktur.
Zwei eigene Produkte setzen direkt auf dieser lokalen Inferenz auf. Die NCA MCP Middleware macht Unternehmensdaten aus ERP, Warenwirtschaft, Zeiterfassung und CRM als geprüfte Tools für Agenten nutzbar, das Modell dahinter läuft über Ollama im eigenen Netz. Die NCA PHP AI Guardrails sichern ab, dass der Code aus einem lokalen Modell mit Specs, Tests und Quality Gates ins bestehende Projekt passt.
Teams begleiten wir vom ersten Prototyp bis in die Production. Wir übernehmen die Beratung zum Selbsthosten von KI-Assistenten, planen eine Self Hosted KI-Architektur für Unternehmen mit Multi Tenant und sorgen mit unserer Vibe Coding Datenschutz und DSGVO-Beratung dafür, dass sensible Daten das Firmennetz nie verlassen. Wer Ollama neu ins Team bringt, findet im Vibe Coding Onboarding den passenden Einstieg, während unser Vibe Coding Consulting die Gesamtstrategie liefert und ein Codebase Audit für KI generierten Code die Qualität absichert.
Ein Tag inhouse mit Benjamin Klein für Developer, Tester und Admins. Context Engineering, Harness, ADRs und zwei Hands on Blöcke mit KI Agenten in eurem Setup.
KI Schulung für Mitarbeiter ohne Vorkenntnisse: ein Tag inhouse mit Live Demo und Live Coding, am Ende steht ein eigenes Tool für eure Abteilung
Mehr erfahrenDie V4 Familie ist seit dem 24. April 2026 draußen, inzwischen komplett mit V4-Pro und V4-Flash. Am 31. Juli kam der Nachschlag: DeepSeek-V4-Flash-0731 liegt als eigener Tag in der Ollama Cloud. Gleiche Architektur, gleiche Größe, neu post trainiert. Ollama nennt als Grund für das Update ausdrücklich die stärkeren agentischen Fähigkeiten. Einen Tag nach dem Start folgte ein Durchsatz Update, das den Tag laut Ollama gut doppelt so schnell macht.
Das Modell bringt eine Million Token Kontext mit und drei wählbare Denkstufen: schnelle Antwort ganz ohne Reasoning, normales Thinking für saubere Logik und Max Thinking für die harten Fälle. Damit taugt es als Backbone für Coding Agents wie Claude Code, OpenClaw, den Hermes Agent oder OpenCode und übernimmt dort Recherche, Code Generierung, Refactoring und mehrstufige Tool Aufrufe. Der lange Kontext erlaubt komplette Codebases in einer Session.
# V4-Flash 0731 direkt aus der Ollama Cloud starten
ollama run deepseek-v4-flash:0731-cloud
# Als Backend fuer Coding Agents
ollama launch claude --model deepseek-v4-flash:0731-cloud
ollama launch opencode --model deepseek-v4-flash:0731-cloud
ollama launch hermes --model deepseek-v4-flash:0731-cloud
ollama launch openclaw --model deepseek-v4-flash:0731-cloud
Ein Flag entscheidet, welches Modell unter deinem Agenten arbeitet. Der Agent bleibt, das Backbone wird getauscht. Beide V4 Modelle stehen unter MIT Lizenz und eignen sich als Cloud Ergänzung zu lokal gehosteten Setups. Wichtig bleibt die Trennung: Cloud Tags laufen auf fremder Infrastruktur, nicht auf deiner Hardware. Die vollständige Einordnung mit Preisen, Benchmarks und DSGVO Risiken steht in unserem Artikel zu DeepSeek V4 für Entwickler. Für die produktive Einbindung in eigene KI Agents unterstützen wir Teams in der Vibe Coding Beratung mit Routing Logik und DSGVO konformem Aufbau.
OpenClaw integriert Ollama seit März 2026 als vollwertigen Model Provider mit nativem Tool Calling. Statt der OpenAI kompatiblen /v1 Schnittstelle nutzt OpenClaw direkt die native Ollama API (http://host:11434 ohne /v1 Suffix), nur so funktionieren Tool Calling und Streaming gleichzeitig stabil.
Schnellstart mit openclaw onboard:
ollama pull glm-4.7-flashopenclaw onboard und Ollama auswählenexport OLLAMA_API_KEY="ollama-local"OpenClaw erkennt alle lokal installierten Modelle automatisch über /api/tags und stellt sie als Provider bereit, inklusive Kontextfenster Erkennung. Cloud Modelle wie kimi-k2.5:cloud oder glm-5:cloud können ergänzend eingebunden werden.
Die vollständige Konfigurationsreferenz, inklusive Remote Setup, expliziter Modell Definitionen und Legacy Modus, findet sich in der offiziellen OpenClaw Dokumentation für den Ollama Provider.
Ollama abstrahiert die Komplexität des lokalen LLM Betriebs in eine einzige CLI Anwendung. Im Hintergrund verwaltet die Plattform Modell Downloads, Quantisierung, GPU Zuweisung und die REST API, alles automatisch. Entwickler müssen sich nicht mit GGUF Dateien, CUDA Treibern oder Kontextfenster Konfiguration herumschlagen.
Die wichtigsten Befehle auf einen Blick:
Seit September 2025 enthält Ollama ein überarbeitetes Model Scheduling: Die präzise Speicherverwaltung reduziert Out of Memory Abstürze und optimiert die GPU Auslastung. Benchmarks zeigen Geschwindigkeitsverbesserungen von bis zu 64 % gegenüber älteren Versionen, beispielsweise 85 Tokens pro Sekunde statt zuvor 52 Tokens pro Sekunde bei vergleichbarer Hardware.
Besonders für Multi GPU Setups bringt das neue Scheduling echte Vorteile: Ollama verteilt die Last intelligent auf alle verfügbaren GPUs und meldet die Speicherauslastung akkurat über Tools wie nvidia-smi. Das macht den lokalen Betrieb auch für größere Modelle mit 30B+ Parametern praxistauglich.
Ollama updaten per CLI: Installer für Linux und macOS, winget für Windows, Docker Image neu ziehen und Fehler 412 beim Modell Pull beheben
Mehr erfahrenDie vielleicht wichtigste Neuerung: Ollama unterstützt jetzt Subagenten und Websuche direkt in Claude Code, ganz ohne MCP Server, API Keys oder Docker Compose Dateien. Ein einziger Befehl reicht:
ollama launch claude --model minimax-m2.5:cloud
Damit startet Claude Code mit dem MiniMax M2.5 Modell aus Ollamas Cloud, inklusive automatischer Subagenten und Websuche Funktionalität. Das Prinzip funktioniert mit jedem Cloud Modell in Ollamas Bibliothek.
Was können Subagenten? Subagenten arbeiten parallel an verschiedenen Aufgaben, jeder in seinem eigenen isolierten Kontext. Das bedeutet konkret:
Die Websuche ist direkt in Ollamas Anthropic Kompatibilitätsschicht integriert. Wenn ein Modell aktuelle Informationen benötigt, etwa Dokumentation zu einem neuen Framework oder aktuelle Sicherheitshinweise, sucht Ollama automatisch und liefert die Ergebnisse. Subagenten können die Websuche parallel nutzen, um mehrere Themen gleichzeitig zu recherchieren.
Ein Beispiel Prompt zeigt die Power:
# Drei parallele Recherche-Agenten starten
> create 3 research agents to research how our top 3 competitors
price their API tiers, compare against our current pricing,
and draft recommendations
Ein einziger Prompt erzeugt drei parallele Workflows: Jeder Agent recherchiert per Websuche die Preise eines Wettbewerbers, vergleicht die Ergebnisse mit der eigenen Preisstruktur und erarbeitet gemeinsam Empfehlungen, alles gleichzeitig.
Vibe Coding – die KI-gestützte Entwicklung, bei der Entwickler Ergebnisse in natürlicher Sprache beschreiben und die KI den Code generiert – profitiert enorm von lokalen Modellen. Ollama ist dabei der lokale Motor, der die Brücke zwischen Datenschutz und Produktivität schlägt.
Die Vorteile von Ollama im Vibe Coding Workflow:
In der Praxis lässt sich Ollama nahtlos in gängige IDEs integrieren. Die beliebtesten Setups für Vibe Coder 2026:
Nicht jedes Modell eignet sich für jeden Einsatzzweck. Ollamas Bibliothek umfasst über 150 Modelle, von kompakten 1B Parametern bis hin zu Schwergewichten mit 100B+. Entscheidend ist die Passung zwischen verfügbarer Hardware (vor allem VRAM), Modellgröße und Anwendungsfall.
Cloud Modelle mit Subagenten Support (für ollama launch claude):
Lokale Modelle nach Hardware Budget:
Tipp für den Einstieg: Mit ollama pull qwen2.5-coder bekommt man ein solides Code Modell, das auf den meisten modernen Laptops mit 16 GB RAM flüssig läuft. Wer Apple Silicon nutzt (M1/M2/M3/M4), profitiert von der Unified Memory Architecture: Ollama nutzt GPU und RAM gemeinsam, was deutlich größere Modelle ermöglicht als bei vergleichbaren Windows Laptops.
Ollama läuft nach der Installation auf den meisten Systemen als Hintergrunddienst und belegt dauerhaft Arbeitsspeicher und beim Modellladen auch GPU Ressourcen. Wer Ollama gezielt stoppen oder den Autostart abschalten möchte, geht je nach Betriebssystem unterschiedlich vor. Hier die drei wichtigsten Wege für 2026.
Ubuntu und andere Linux Distributionen mit systemd: Bei der offiziellen Linux Installation wird Ollama als systemd Service eingerichtet. Das ist der saubere Weg zum Stoppen und Deaktivieren:
# Service sofort stoppen
sudo systemctl stop ollama.service
# Autostart beim Systemstart deaktivieren
sudo systemctl disable ollama.service
# Status prüfen, sollte inactive zeigen
sudo systemctl status ollama.service
Falls Ollama trotz systemctl stop noch über http://localhost:11434 erreichbar ist, läuft meist eine zweite Instanz im Hintergrund, oft ein manuell gestarteter ollama serve Prozess in einem anderen Terminal. Hier hilft pkill ollama oder gezielt kill mit der PID aus pgrep ollama.
macOS: Die Desktop App registriert sich im Menüleisten Bereich oben rechts. Über das Ollama Icon erreichst du den Menüpunkt Quit Ollama und beendest damit den Hintergrunddienst sauber. Für ein dauerhaftes Autostart Off klickst du im selben Menü Settings und deaktivierst Open Ollama at login.
Windows: Im System Tray rechts unten in der Taskleiste findest du das Ollama Symbol. Rechtsklick auf das Icon und Quit Ollama beendet den Dienst. Den Autostart entfernst du im Task Manager unter dem Tab Autostart, indem du den Ollama Eintrag deaktivierst.
Für den schnellen Check ob Ollama gerade lauscht, eignet sich auf jedem System ein simpler HTTP Request gegen den Default Port:
curl http://localhost:11434
# Antwort 'Ollama is running' bedeutet aktiv
# Connection refused bedeutet gestoppt
Wer Ollama dauerhaft als Production Inferenz Server betreiben will, etwa auf eigenen Servern in Deutschland, sollte den Service nicht stoppen sondern hinter Firewall und Reverse Proxy absichern. NCA übernimmt das im Rahmen der Vibe Coding Consulting Projekte und richtet auf Wunsch eine Self Hosted KI für Unternehmen ein. Default direkt über Ollama, bei Bedarf gehostete Inferenz über Partner Conversis.
Je nach Projektanforderung, Teamgröße und Datenschutz-Sensibilität kann Ollama die Cloud-API komplett ersetzen – oder sinnvoll ergänzen.
Die besten lokalen Coder Modelle 2026 im Vergleich, von Qwen über Devstral bis DeepSeek und Phi, mit VRAM Bedarf, Stärken und passender Hardware für Ollama
Mehr erfahrenOllama lokal aufsetzen ist einfach. Ollama produktiv im Team betreiben mit Sicherheitskonfiguration, CI/CD-Integration und optimierter Hardware Auswahl erfordert Erfahrung. Genau hier unterstützt Never Code Alone als Technologie Partner.
Unsere Leistungen rund um lokale KI-Infrastruktur:
In NCA-Projekten sehen wir regelmäßig, dass der Sprung von der lokalen Ollama Installation zum stabilen Team Betrieb an Sicherheit, Routing und Hardware scheitert. Genau diese Themen decken wir ab: vom Vibe Coding Security Audit über die DSGVO-Beratung bis zur Frage, ob ein Hybrid Ansatz aus lokalen Modellen und Cloud sinnvoll ist. Ob Ollama für deinen Use Case die richtige Wahl ist, klären wir gemeinsam im Beratungsprojekt.
Zwei NCA Produkte laufen im Kern auf lokaler Inferenz. Ollama liefert das Modell, die Hardware steht im eigenen Netz, die Daten bleiben da, wo sie hingehören. Cloud ist eine Option, keine Voraussetzung.
NCA MCP Middleware bringt Unternehmensdaten aus ERP, Warenwirtschaft, Zeiterfassung und CRM als saubere Tools an die Agenten. Der Agent fragt nicht die Datenbank, sondern ein definiertes Tool und bekommt geprüfte Werte zurück. Als Modell reicht dafür ein lokales Qwen3 Coder oder Llama über Ollama. Betrieb wahlweise bei uns oder komplett in eurer eigenen Infrastruktur, ergänzt um Self Hosted KI mit Multi Tenant.
NCA PHP AI Guardrails ist die Antwort auf die zweite Hälfte des Problems. Ein lokales Modell schreibt Code, aber ohne Specs, Tests und Quality Gates passt dieser Code selten ins bestehende Projekt. Vier Guardrail Ebenen mit PHPStan, Rector und PHPUnit sorgen dafür, dass die Ausgabe eines lokalen Modells denselben Standard trifft wie handgeschriebener Code. Für die Einordnung, wann lokale Modelle wirtschaftlich sind, hilft der Beitrag zu lokaler KI als ROI Treiber.
Der Unterbau ist bei beiden Produkten derselbe: Ollama lokal, Modellauswahl nach vorhandener Hardware, Betrieb im eigenen Netz. Wo Berufsgeheimnis oder Auftragsverarbeitung im Spiel sind, lohnt vorher der Blick auf lokale KI für Compliance. Wer die Inferenz nicht selbst betreiben will, bekommt sie als Enterprise Option gehostet über unseren Duisburger Netzwerkpartner Conversis. Den Weg zum eigenen Setup zeigt die Seite zu KI Assistenten selbst hosten.
Roland Golla ist Entwickler aus Leidenschaft – seit über 20 Jahren. Er hat hunderte Projekte begleitet, von Legacy-Refactoring bis KI-Integration. Bei Vibe Coding verbindet er das Beste aus beiden Welten: Die Geschwindigkeit von KI-generiertem Code mit der Qualität professioneller Softwareentwicklung. Kein Bullshit, keine Agentur-Floskeln – direkte Hilfe von jemandem, der selbst täglich im Code steckt.
Die wichtigsten Fragen rund um Ollama, lokale KI-Modelle, Subagenten und den Einsatz im professionellen Entwicklungsalltag – kompakt beantwortet.
Ollama ist eine Open-Source-Plattform zum lokalen Ausführen großer Sprachmodelle (LLMs). Entwickler nutzen Ollama 2026 für DSGVO-konformes KI-Coding, Offline-Entwicklung und als lokales Backend für Tools wie Claude Code, Continue und Cline. Die Plattform unterstützt über 150 Modelle und erfordert keine Cloud-Anbindung.
Die wichtigsten Neuerungen 2026 sind Subagenten für parallele Aufgabenausführung in Claude Code und eine integrierte Websuche ohne MCP-Server. Dazu kommt ein überarbeitetes Model Scheduling mit bis zu 64 % mehr Geschwindigkeit und präziserer Speicherverwaltung für Multi-GPU-Setups.
Ja, Ollama ist ideal für DSGVO-konforme KI-Nutzung. Alle Daten bleiben auf dem lokalen Rechner – es werden keine Prompts, Code-Snippets oder Unternehmensdaten an externe Server gesendet. Damit entfällt die Notwendigkeit einer Auftragsverarbeitungsvereinbarung mit Cloud-Anbietern.
Die Mindestanforderung sind 8 GB RAM für kleine Modelle (3-4B Parameter). Für produktives Vibe Coding empfehlen sich 16 GB RAM und eine GPU mit mindestens 8 GB VRAM. Apple-Silicon-Macs (M1 bis M4) profitieren besonders, da Ollama Unified Memory nutzt und so größere Modelle möglich sind.
Subagenten sind parallele KI-Instanzen, die jeweils in einem eigenen Kontext arbeiten. Sie werden über Cloud-Modelle wie MiniMax M2.5, GLM-5 oder Kimi K2.5 getriggert. Entwickler können damit mehrere Aufgaben gleichzeitig bearbeiten lassen – etwa Code-Analyse, Dateisuche und Recherche parallel statt nacheinander.
Ollama selbst ist kostenlos und Open Source. Die lokale Nutzung verursacht keine laufenden Kosten – die einzige Investition ist die Hardware. Für Cloud-Modelle bietet Ollama ein großzügiges kostenloses Kontingent an Websuchen, mit höheren Rate Limits über Ollamas Cloud-Abonnement.
Für Code-Generierung empfiehlt sich Qwen 2.5 Coder oder DeepSeek Coder V2. Für allgemeine Chat-Aufgaben ist Llama 3.2 ein guter Einstieg. Cloud-Modelle wie MiniMax M2.5 eignen sich besonders für agentisches Coding mit Subagenten. Die Modellwahl hängt primär vom verfügbaren VRAM ab.
Ja, über die Continue Extension für VS Code lässt sich Ollama nahtlos als lokales KI-Backend einbinden. Nach der Installation verbindet man Continue mit dem Ollama-Endpoint auf localhost:11434 und erhält Code-Completion, Chat und agentische Features direkt in der IDE.
Ollama ist CLI-fokussiert und optimiert für Automatisierung und Servernutzung. LM Studio bietet eine grafische Oberfläche zum Herunterladen und Testen von Modellen. Für Vibe Coding mit IDEs eignen sich beide, wobei Ollama besonders bei Headless-Betrieb und Scripting Vorteile hat.
Ollama von ollama.com herunterladen und installieren. Dann im Terminal ollama run llama3.2 eingeben – das Modell wird automatisch heruntergeladen und startet einen Chat. Für IDE-Integration zusätzlich die Continue Extension in VS Code installieren und mit Ollama verbinden.
Ja, seit dem Update im September 2025 verteilt Ollama die Last intelligent auf mehrere GPUs. Die neue Speicherverwaltung meldet akkurate Auslastungsdaten und ermöglicht es, größere Modelle über mehrere Grafikkarten zu verteilen – besonders relevant für 30B+ Parameter-Modelle.
Ja, Ollama unterstützt multimodale Modelle seit Mai 2025. Modelle wie Llama 3.2 Vision (11B und 90B), Gemma 3 und Qwen 2.5 VL können Bilder analysieren, Texte aus Dokumenten extrahieren und visuelle Aufgaben lösen – alles lokal und ohne Cloud.
Da alle Daten lokal bleiben, bietet Ollama von Haus aus ein hohes Sicherheitsniveau. Für den Produktiveinsatz empfiehlt sich zusätzlich: den API-Zugang per Firewall einschränken, HTTPS für Remote-Zugriffe konfigurieren und regelmäßige Updates einspielen. NCA berät zu sicheren Self-Hosted-Setups.
Für viele Anwendungsfälle ja – besonders bei Datenschutz-Anforderungen, Offline-Szenarien und kostensensibler Nutzung. Für Aufgaben, die Frontier-Modellqualität erfordern (komplexe Reasoning-Aufgaben, sehr lange Kontexte), bleiben Cloud-APIs wie Claude oder GPT-4o aktuell überlegen. Ein Hybrid-Ansatz ist oft die beste Lösung.
Ollama läuft auf Ubuntu als systemd Service. Mit sudo systemctl stop ollama.service beendest du den Dienst sofort. Mit sudo systemctl disable ollama.service verhinderst du zusätzlich den Autostart beim nächsten Neustart. sudo systemctl status ollama.service zeigt den aktuellen Status, inactive bedeutet erfolgreich gestoppt.
Klick auf das Ollama Icon in der Menüleiste oben rechts und wähle Quit Ollama. Damit wird der Hintergrunddienst sauber beendet. Den Autostart deaktivierst du in den Ollama Settings unter Open Ollama at login. Bei hartnäckigen Prozessen hilft pkill ollama oder kill mit der PID aus pgrep ollama im Terminal.
Im System Tray rechts unten in der Taskleiste findest du das Ollama Symbol. Rechtsklick auf das Icon und Quit Ollama beendet den Dienst. Den Autostart entfernst du im Task Manager unter dem Tab Autostart, indem du den Ollama Eintrag deaktivierst. So lädt Ollama beim nächsten Neustart nicht mehr automatisch.
Auf Linux mit sudo systemctl disable ollama.service. Auf macOS in den Ollama Settings den Punkt Open Ollama at login deaktivieren. Auf Windows im Task Manager unter Autostart den Ollama Eintrag ausschalten. Damit lädt Ollama nicht mehr beim Systemstart und belegt keinen Arbeitsspeicher im Hintergrund.
Der schnellste Test funktioniert auf jedem Betriebssystem mit curl http://localhost:11434. Eine Antwort Ollama is running bedeutet aktiv, Connection refused bedeutet gestoppt. Auf Linux liefert sudo systemctl status ollama.service zusätzliche Details, auf macOS und Windows reicht der Blick auf das Tray bzw. Menüleisten Icon.