Eliminierung technischer Schulden mit PHPStan, Rector PHP und PHPUnit. Über 20 Jahre Praxiserfahrung in skalierbaren Backends.
- Aktualisiert:
- Autor:
- Roland Golla
oMLX: Definition und Einordnung
Inhalt
oMLX mit NCA: Schnelle Hilfe vom Experten
Lokale KI Inferenz mit NCA einordnen
Finde das passende Angebot für dein Projekt
Anfrage-Konfiguration
Starten Sie Ihre Anfrage
Gesetzliche Konformität & Inklusion. Optimierung von Performance und Conversion durch radikal nutzerzentriertes, universelles Design.
Skalierbare KI-Systeme mit echtem Code Ownership. CI/CD, Backup-Strategien und Infrastruktur, die mit deinem Team wächst.
Anfrage-Konfiguration
Worauf liegt dein Fokus?
Wähle die Expertise, die dein Projekt jetzt am dringendsten benötigt.
Der zweistufige KV Cache als Kernidee
Installation auf dem Mac
brew tap jundot/omlx https://github.com/jundot/omlx
brew install jundot/omlx/omlx
omlx start
omlx stop
omlx restart
git clone https://github.com/jundot/omlx.git
cd omlx
pip install -e .
omlx serve --model-dir ~/models
API und Anbindung an Terminal Agents
POST /v1/chat/completions
POST /v1/completions
POST /v1/messages
POST /v1/embeddings
POST /v1/rerank
GET /v1/models
Modelle, Tool Calling und MCP
omlx serve --model-dir ~/models --mcp-config mcp.json
omlx serve --model-dir ~/models --paged-ssd-cache-dir ~/.omlx/cache
omlx serve --model-dir ~/models --max-concurrent-requests 16
omlx serve --model-dir ~/models --api-key dein-schluessel
Hardware und die ehrliche Grenze
Datenschutz und Betrieb im Team
oMLX im Vergleich zu anderen lokalen Servern
| Werkzeug | Plattform | Passt, wenn |
|---|---|---|
| oMLX | nur macOS auf Apple Silicon | du am Mac arbeitest und Agenten über viele Runden am selben Projekt laufen lässt |
| Ollama | macOS, Linux, Windows | du plattformübergreifend arbeitest und den einfachsten Einstieg suchst |
| LM Studio | macOS, Linux, Windows | du eine grafische Oberfläche zum Ausprobieren und Vergleichen von Modellen willst |
| llama.cpp | praktisch überall | du maximale Kontrolle brauchst und dich mit Flags und Quantisierung auskennst |
LLM inference, optimized for your Mac.
oMLX in der Beratungspraxis bei NCA
NCA Vibe Coding Consulting
Roland Golla ist Entwickler aus Leidenschaft – seit über 20 Jahren. Er hat hunderte Projekte begleitet, von Legacy-Refactoring bis KI-Integration. Bei Vibe Coding verbindet er das Beste aus beiden Welten: Die Geschwindigkeit von KI-generiertem Code mit der Qualität professioneller Softwareentwicklung. Kein Bullshit, keine Agentur-Floskeln – direkte Hilfe von jemandem, der selbst täglich im Code steckt.
Häufige Fragen zu oMLX
Was ist oMLX 2026?
oMLX ist ein nativer macOS Server für lokale Sprachmodelle auf Apple Silicon. Er baut auf Apples MLX Framework auf, läuft als Menu Bar App oder im Terminal und stellt eine API bereit, die sowohl das OpenAI als auch das Anthropic Format spricht. Das Projekt steht unter Apache 2.0 Lizenz auf GitHub.
Wie unterscheidet sich oMLX 2026 von Ollama?
Ollama läuft auf macOS, Linux und Windows und ist der einfachste Einstieg in lokale Modelle. oMLX gibt es nur für Apple Silicon und setzt einen anderen Schwerpunkt: Der Key Value Cache wird zusätzlich auf die SSD geschrieben und bleibt über Anfragen und Neustarts hinweg erhalten. Für Agenten, die lange am selben Projekt arbeiten, macht das den Unterschied.
Welche Hardware brauche ich für oMLX 2026?
Einen Mac mit Apple Chip und macOS 15 oder neuer. Entscheidend ist der Arbeitsspeicher, weil Prozessor und Grafikeinheit ihn sich teilen und ein Modell vollständig hineinpassen muss. Für ernsthafte Arbeit mit größeren Modellen sind 64 GB oder mehr sinnvoll. Kleinere Modelle laufen auch darunter.
Läuft ein großes Coding Modell 2026 auf meinem Mac?
Bei den aktuellen Spitzenmodellen für Coding in aller Regel nicht. Sie brauchen Arbeitsspeicher in einer Größenordnung, die kein üblicher Arbeitsrechner mitbringt. Unsere Regel: Coding kommt aus der Cloud über souveräne europäische Anbieter, Datenverarbeitung bleibt im eigenen Netz. Lokal laufen kleinere Modelle für überschaubare Aufgaben.
Funktioniert oMLX 2026 mit OpenCode?
Ja. oMLX stellt sowohl den OpenAI Endpunkt als auch einen nativen Anthropic Endpunkt bereit und funktioniert damit als Backend für OpenCode und andere Terminal Agents. Das Admin Dashboard erzeugt den passenden Konfigurationsbefehl für das jeweilige Werkzeug.
Muss ich meine Modelle neu herunterladen?
Nein. oMLX liest den Standard Cache von Hugging Face mit, den sich auch Transformers, MLX und llama.cpp teilen. Zusätzlich findet der Server den Modellordner von LM Studio und eigene Verzeichnisse. Über das Admin Dashboard lassen sich neue Modelle direkt von Hugging Face laden.
Welche Modelltypen unterstützt oMLX?
Neben klassischen Sprachmodellen laufen Vision Modelle, OCR Modelle, Embedding Modelle und Reranker im selben Prozess. Alle vier Typen können gleichzeitig geladen sein. Wird der Speicher knapp, entlädt der Server das am längsten ungenutzte Modell automatisch.
Wie funktioniert Tool Calling in oMLX?
Jede Modellfamilie schreibt Werkzeugaufrufe in einem eigenen Format. oMLX erkennt die gängigen Varianten automatisch, von JSON über XML bis zu namensraumbasierten Formaten. Voraussetzung ist, dass das Chat Template des Modells Werkzeuge überhaupt annimmt. Zusätzlich lässt sich eine MCP Konfiguration übergeben.
Ist oMLX DSGVO konform?
Der Server selbst verarbeitet lokal, es fließen keine Prompts an Dritte. Damit entfällt die Frage nach einem Auftragsverarbeitungsvertrag für die Inferenz. Die restliche Bewertung hängt vom Kontext ab: welche Daten verarbeitet werden, wer Zugriff auf den Rechner hat und wie der Server im Netz abgesichert ist.
Kann ich oMLX im Team betreiben?
Technisch ja. Über Homebrew läuft der Server als Hintergrunddienst mit automatischem Neustart. Wer ihn über localhost hinaus öffnet, muss den API Schlüssel setzen und den Zugang im Netz absichern. Ein offener Inference Server im Firmennetz ist ein Sicherheitsproblem.
Warum ist die Installation aus dem Quellcode langsamer?
Ein einfaches pip install baut die nativen Metal Kernel nicht mit. Betroffene Modellfamilien fallen dann still auf einen deutlich langsameren Pfad zurück und brauchen mehr Speicher. Für den Bau der Kernel wird das komplette Xcode benötigt. Die offizielle DMG bringt sie fertig kompiliert mit.
Wofür lohnt sich lokale Inferenz überhaupt?
Für alles, was in Masse anfällt und keine Spitzenintelligenz braucht: Embeddings, Reranking, OCR, Klassifikation, Zusammenfassungen, kleine wiederkehrende Agentenaufgaben. Dort spart der lokale Betrieb echtes Geld und hält sensible Daten im Haus. Für komplexe Refactorings ist die Cloud die bessere Wahl.
Microsofts Open-Source-Framework für Multi-Agent-Systeme – autonome KI-Agenten, die miteinander kommunizieren und komplexe Aufgaben lösen.
Open-Source KI-Assistent mit 60.000+ GitHub Stars, der über WhatsApp, Telegram und andere Messaging-Apps gesteuert wird.