Aleph Alpha Kolibri erklärt: 78B Mixture of Experts, Deutsch und Englisch, Apache 2.0, Hardware Bedarf und für wen das souveräne Modell passt.
Mehr erfahren
Ministral ist die Familie der kleinen KI Modelle von Mistral AI aus Frankreich. Sie kommt in drei Größen mit drei, acht und vierzehn Milliarden Parametern und ist für Geräte gedacht, auf denen ein großes Modell keinen Platz hat: Laptops, kleine Server, Industrie PCs und Edge Geräte. Die Gewichte stehen unter der Lizenz Apache 2.0 offen zur Verfügung.
Alle drei Größen der aktuellen Generation verstehen Text und Bilder, rufen Werkzeuge auf, arbeiten mehrsprachig und verarbeiten rund 256.000 Tokens Kontext. Jede Größe gibt es in drei Varianten: als Basismodell zum Nachtrainieren, als Instruct Modell für den direkten Einsatz und als Reasoning Modell, das vor der Antwort nachdenkt. Quelle sind die Ankündigung von Mistral AI und die Modellkarten auf Hugging Face.
Der Name ist Programm: Mini plus Mistral. Genau das ist die Idee hinter der Familie. Viel Rechenleistung bei geringem Energiebedarf, dort wo die Daten entstehen, ohne Umweg über ein Rechenzentrum.
Wir betreiben kleine Modelle lokal mit Ollama und binden sie als Schritt in n8n Workflows ein. So bleiben Daten im eigenen Netz, und die Aufgabe läuft trotzdem automatisch: Mails sortieren, Formulare auslesen, Texte vorklassifizieren. Ministral hat für genau diese Aufgaben Stärken. Wir helfen Teams, die passende Größe einzuordnen und zu erkennen, wo ein größeres Modell übernehmen muss.
Der NCA KI Workshop gibt eurem Team einen gemeinsamen Rahmen für KI. Workshoptag inhouse, optional mit Praxistag, als Variante für Developer oder alle Abteilungen.
Laut Modellkarten bringen alle drei Größen diese Eigenschaften mit:
Ministral 3 ist gemeinsam mit dem Flaggschiff Mistral Large 3 als Teil der Modellgeneration Mistral 3 erschienen. Die Familie ist bewusst für kleine Hardware gebaut und bekommt dieselbe Pflege wie die großen Modelle.
Alle drei Größen sind dichte Modelle, keine Mixture of Experts. Das macht sie einfach zu betreiben: Die Gewichte passen komplett in den Speicher, und es gibt keinen Router, der Teilnetze auswählt. Mit Ollama oder LM Studio läuft Ministral in wenigen Minuten auf einem Laptop.
Quantisierte Fassungen im GGUF Format schrumpfen den Speicherbedarf weiter, das 3B Modell kommt dann mit rund zwei Gigabyte aus. Wie ihr die passende Quantisierung wählt, erklärt unsere Seite zur GGUF Quantisierung. Wann sich lokale KI wirtschaftlich rechnet, steht bei Lokale KI wirtschaftlich.
Für Compliance ist das der entscheidende Vorteil: Das Modell läuft auf dem Gerät oder im eigenen Netz, kein Byte verlässt das Haus. Was das für Berufsgeheimnis und DSGVO bedeutet, zeigt der Eintrag Lokale KI für Compliance.
Ein kleines Modell kann nicht alles. Es kann aber eine klar umrissene Aufgabe zuverlässig und schnell. Das sind die typischen Einsätze, die wir in Workflows sehen:
Für freie Texte, komplexes Reasoning und lange Agentenketten stößt Ministral an Grenzen. Dann übernimmt Mistral Small oder das Flaggschiff Mistral Large. Ein LLM Routing verteilt die Anfragen automatisch nach Schwierigkeit.
Ministral passt gut, wenn diese Punkte auf euch zutreffen:
Ministral passt weniger, wenn ihr diese Ziele habt:
Eine Alternative aus Deutschland in ähnlicher Größenordnung ist Soofi S mit rund drei Milliarden aktiven Parametern, allerdings als Mixture of Experts mit höherem Speicherbedarf.
Les Ministraux were built to provide a compute-efficient and low-latency solution for these scenarios.
Aleph Alpha Kolibri erklärt: 78B Mixture of Experts, Deutsch und Englisch, Apache 2.0, Hardware Bedarf und für wen das souveräne Modell passt.
Mehr erfahrenBei kleinen Modellen entscheidet die Aufgabenzuschneidung. Je enger die Aufgabe, desto zuverlässiger das Ergebnis. Wir gehen das in klaren Schritten an:
Wer das Thema im ganzen Unternehmen verankern will, findet den passenden Rahmen im NCA KI Workshop für Unternehmen. Am Anfang steht ein kostenloses Kennenlernen, abgerechnet wird transparent nach Minuten.
Roland Golla ist Entwickler aus Leidenschaft – seit über 20 Jahren. Er hat hunderte Projekte begleitet, von Legacy-Refactoring bis KI-Integration. Bei Vibe Coding verbindet er das Beste aus beiden Welten: Die Geschwindigkeit von KI-generiertem Code mit der Qualität professioneller Softwareentwicklung. Kein Bullshit, keine Agentur-Floskeln – direkte Hilfe von jemandem, der selbst täglich im Code steckt.
Hier beantworten wir die wichtigsten Fragen zu Ministral, seiner Hardware, der Lizenz und dem Einsatz im Unternehmen.
Ministral ist die Familie der kleinen KI Modelle von Mistral AI aus Frankreich in den Größen drei, acht und vierzehn Milliarden Parameter. Alle verstehen Text und Bilder, rufen Werkzeuge auf und verarbeiten rund 256.000 Tokens Kontext. Die Gewichte stehen unter Apache 2.0 offen zur Verfügung.
Ja, die Gewichte stehen unter Apache 2.0 auf Hugging Face. Ihr dürft sie kommerziell nutzen und anpassen. Da die Modelle auf normaler Hardware laufen, fallen oft gar keine Betriebskosten an, abgesehen vom Strom. Mistral bietet die Modelle zusätzlich über die eigene API an.
Ja. Das 3B Modell braucht rund acht Gigabyte Speicher in FP8 und quantisiert noch weniger, das 8B Modell rund zwölf Gigabyte. Beide laufen auf aktuellen Laptops mit GPU oder auf Macs mit Apple Silicon. Das 14B Modell braucht eine Workstation oder einen Server mit einer GPU.
Die Zahl ist die Größe in Milliarden Parametern. Je größer, desto besser das Sprachverständnis und das Reasoning, aber auch der Speicherbedarf. Für einfache Klassifikation reicht oft 3B, für Zusammenfassungen und Extraktion 8B, für anspruchsvollere Aufgaben 14B. Ein Test mit euren Daten zeigt, welche Größe reicht.
Base ist das rohe Modell zum Nachtrainieren auf eigene Daten. Instruct folgt Anweisungen und ist für den direkten Einsatz gedacht. Reasoning denkt vor der Antwort in Zwischenschritten nach und eignet sich für Aufgaben mit mehreren Schritten. Für die meisten Workflows ist Instruct die richtige Wahl.
Ja, alle drei Größen haben einen kleinen Bildencoder. Sie erkennen Inhalte auf Fotos, Scans und Screenshots und können zum Beispiel prüfen, ob ein Dokument lesbar ist oder welche Art von Beleg zu sehen ist. Für komplexe Bildanalysen sind größere Modelle besser geeignet.
Sehr gut, vor allem für Vorsortierung und Extraktion. Das Modell läuft lokal über Ollama, n8n ruft es als einen Schritt auf, und nur die unsicheren Fälle gehen an ein größeres Modell oder an einen Menschen. So bleiben die Daten im eigenen Netz und der Workflow bleibt schnell.
Ja. Ministral läuft mit Ollama oder LM Studio lokal auf Laptop, Mini PC oder Server. Quantisierte Fassungen im GGUF Format senken den Speicherbedarf weiter, das 3B Modell kommt dann mit rund zwei Gigabyte aus. Wichtig für Workflows: eine feste Modellversion wählen, damit sich das Verhalten nach Updates nicht unbemerkt ändert.
Die erste Generation kam 2024 mit zwei Größen, 3B und 8B, rund 128.000 Tokens Kontext und einer kommerziellen Lizenz, für die man Mistral kontaktieren musste. Die aktuelle Generation bringt eine dritte Größe mit 14B, versteht Bilder, verdoppelt den Kontext und steht komplett unter Apache 2.0.
Das Modell ist ein Werkzeug, DSGVO Konformität hängt am Betrieb. Weil Ministral lokal auf dem Gerät oder im eigenen Netz läuft, verlassen die Daten das Unternehmen nicht. Das ist die einfachste Ausgangslage, die es gibt. Zugriffsrechte und Logging müsst ihr trotzdem regeln.
Ministral ist klein, dicht und für Laptop und Edge gedacht. Mistral Small ist größer, als Mixture of Experts gebaut und für GPU Server oder API gedacht. Ministral reicht für klar umrissene Aufgaben, Mistral Small übernimmt freie Texte, komplexere Zusammenfassungen und Agenten.
Wir grenzen mit euch die Aufgabe ein, testen die drei Größen mit anonymisierten Daten, betreiben das passende Modell lokal mit Ollama und bauen es als Schritt in einen n8n Workflow ein, mit Eskalation an ein größeres Modell oder einen Menschen. Am Anfang steht ein kostenloses Kennenlernen, abgerechnet wird nach Minuten.