Aleph Alpha Kolibri erklärt: 78B Mixture of Experts, Deutsch und Englisch, Apache 2.0, Hardware Bedarf und für wen das souveräne Modell passt.
Mehr erfahren
Mistral Small ist die mittlere Modellreihe des französischen KI Unternehmens Mistral AI und das typische Arbeitsmodell für wiederkehrende Aufgaben in Workflows. Die Gewichte stehen unter der Lizenz Apache 2.0 offen zur Verfügung, ihr dürft sie also herunterladen, anpassen und kommerziell nutzen. Das Modell versteht Text und Bilder, ruft Werkzeuge auf und arbeitet in über zwanzig Sprachen, Deutsch eingeschlossen.
Die aktuelle Generation führt zusammen, was Mistral vorher auf drei Modellreihen verteilt hatte: Reasoning, Bildverständnis und agentisches Coding in einem Modell. Der Name täuscht. Mistral Small ist ein Mixture of Experts Modell mit 119 Milliarden Parametern, von denen pro Token nur rund sechs Milliarden aktiv sind. Quelle sind die Ankündigung von Mistral AI und die Modellkarte auf Hugging Face.
Für Teams, die ein Modell auf einer einzelnen GPU brauchen, bleibt die vorige Generation mit 24 Milliarden Parametern interessant. Wer noch kleiner will, greift zur Modellfamilie Ministral.
Wir bauen täglich n8n Workflows, in denen KI Modelle wiederkehrende Aufgaben übernehmen: Anfragen klassifizieren, Dokumente zusammenfassen, Felder extrahieren, Entwürfe schreiben. Mistral Small hat genau dort Stärken, und wir helfen Teams, es gegen kleinere und größere Modelle einzuordnen. Für den Betrieb kommen ein Hoster in Deutschland oder europäische Inferenz Anbieter wie TensorX infrage, als Enterprise Option für gehostete Inferenz mit DSGVO Fokus auch unser Netzwerkpartner Conversis in Duisburg.
Der NCA KI Workshop gibt eurem Team einen gemeinsamen Rahmen für KI. Workshoptag inhouse, optional mit Praxistag, als Variante für Developer oder alle Abteilungen.
Laut Modellkarte bringt die aktuelle Generation diese Eigenschaften mit:
Mistral betont für die aktuelle Generation vor allem den Durchsatz: deutlich mehr Anfragen pro Sekunde und kürzere Antwortzeiten als die Vorgänger. Für Workflows, in denen viele kleine Aufgaben nacheinander laufen, ist das wichtiger als der letzte Punkt in einem Benchmark.
Die aktuelle Generation ist ein Mixture of Experts Modell. Es besteht aus vielen Teilnetzen, und ein Router wählt für jedes Token nur wenige davon aus. Von 119 Milliarden Parametern arbeiten so pro Token nur rund sechs Milliarden. Das macht Antworten schnell und günstig im Betrieb. Im Speicher liegen müssen trotzdem alle Gewichte, in voller Präzision sind das rund 240 Gigabyte.
Kurz gesagt: Mistral Small 4 gehört auf einen GPU Server bei einem Hoster oder zu einem europäischen API Anbieter, nicht auf den Laptop. Mit Quantisierung schrumpft der Bedarf deutlich, wie das geht, erklärt unsere Seite zur GGUF Quantisierung.
Die vorige Generation mit 24 Milliarden Parametern ist ein dichtes Modell und läuft quantisiert auf einer einzelnen GPU mit 24 Gigabyte Speicher. Für viele Teams ist das die praktischere Wahl, wenn das Modell auf einer Workstation oder einem Server bei einem Hoster in Deutschland laufen soll. Ausgeliefert wird in beiden Fällen über vLLM, llama.cpp oder Ollama.
Mistral Small ist von Haus aus ein Allzweckmodell. Zur domänenspezifischen KI wird es durch die Art, wie ihr es einsetzt. Drei Wege haben sich bewährt:
In einem n8n Workflow sitzt Mistral Small dann als ein Schritt zwischen Eingang und Ausgang: Mail kommt rein, Modell sortiert und zieht die Felder, Workflow legt den Vorgang im CRM an, ein Mensch gibt frei. Was ein Foundation Model davon unterscheidet, erklärt unser Eintrag zum Foundation Model.
Mistral Small passt gut, wenn diese Punkte auf euch zutreffen:
Mistral Small passt weniger, wenn ihr diese Ziele habt:
Wie Mistral insgesamt gegen ChatGPT abschneidet, zeigt unser Vergleich ChatGPT und Mistral. Einen Überblick über alle Produkte von Mistral AI gibt der Eintrag Mistral AI.
Mistral Small 4 is fully open source.
Aleph Alpha Kolibri erklärt: 78B Mixture of Experts, Deutsch und Englisch, Apache 2.0, Hardware Bedarf und für wen das souveräne Modell passt.
Mehr erfahrenBei Mistral Small entscheidet selten das Modell allein. Wichtiger sind die Fragen drumherum: Welche Aufgabe soll es lösen? Wo läuft es? Wer prüft die Ergebnisse? Und wie tauscht ihr es aus, wenn eine neue Generation kommt?
Wer das Thema im ganzen Unternehmen verankern will, findet den passenden Rahmen im NCA KI Workshop für Unternehmen. Am Anfang steht ein kostenloses Kennenlernen, abgerechnet wird transparent nach Minuten.
Roland Golla ist Entwickler aus Leidenschaft – seit über 20 Jahren. Er hat hunderte Projekte begleitet, von Legacy-Refactoring bis KI-Integration. Bei Vibe Coding verbindet er das Beste aus beiden Welten: Die Geschwindigkeit von KI-generiertem Code mit der Qualität professioneller Softwareentwicklung. Kein Bullshit, keine Agentur-Floskeln – direkte Hilfe von jemandem, der selbst täglich im Code steckt.
Hier beantworten wir die wichtigsten Fragen zu Mistral Small, seiner Hardware, der Lizenz und dem Einsatz im Unternehmen.
Mistral Small ist die mittlere Modellreihe von Mistral AI aus Frankreich mit offenen Gewichten unter Apache 2.0. Die aktuelle Generation versteht Text und Bilder, kann auf Wunsch in Zwischenschritten nachdenken, ruft Werkzeuge auf und verarbeitet rund 256.000 Tokens Kontext. Sie ist das typische Arbeitsmodell für wiederkehrende Aufgaben in Workflows.
Ja, die Gewichte stehen unter Apache 2.0 auf Hugging Face. Ihr dürft das Modell kommerziell nutzen und anpassen. Kosten entstehen für den Betrieb: GPU Server bei einem Hoster oder Tokenpreise bei einem API Anbieter. Das ist der eigentliche Kostenfaktor, nicht die Lizenz.
Die aktuelle Generation ist ein Mixture of Experts Modell mit 119 Milliarden Parametern und braucht in voller Präzision rund 240 Gigabyte Speicher, also GPU Server beim Hoster. Die vorige Generation mit 24 Milliarden Parametern läuft quantisiert auf einer einzelnen GPU mit 24 Gigabyte. Für Laptops ist Ministral gedacht.
Weil pro Token nur rund sechs Milliarden Parameter aktiv sind. Mistral ordnet seine Modelle nach aktiven Parametern und Betriebskosten, nicht nach Gesamtgröße. Im Betrieb verhält sich das Modell wie ein kleines, im Speicher wie ein großes. Deshalb lohnt der Blick auf beide Zahlen.
Gut. Mistral Small ist mehrsprachig trainiert, Deutsch gehört zu den gut abgedeckten Sprachen. Für Aufgaben, die fast nur auf Deutsch laufen, lohnt trotzdem ein Vergleichstest mit einem Modell wie Aleph Alpha Kolibri, das speziell für Deutsch und Englisch gebaut ist. Entscheidend ist der Test mit euren eigenen Texten.
Die aktuelle Generation hat die Fähigkeiten des früheren Coding Modells Devstral integriert und kann Code schreiben und ändern. Spezialisierte Coding Modelle schneiden bei reinen Programmieraufgaben trotzdem oft besser ab. Für Workflows mit Text, Dokumenten und Werkzeugen ist Mistral Small die bessere Wahl.
Sehr gut. Das Modell antwortet schnell, liefert strukturierte Ausgaben und ruft Werkzeuge zuverlässig auf. In n8n sitzt es als ein Schritt im Workflow: Eingang sortieren, Felder extrahieren, Entwurf schreiben, Mensch gibt frei. Über einen europäischen Anbieter oder einen Hoster in Deutschland bleiben die Daten in Europa.
Ministral ist die Familie der wirklich kleinen Modelle mit drei, acht und vierzehn Milliarden Parametern für Laptop und Edge Gerät. Mistral Small ist größer, stärker und für GPU Server oder API gedacht. Für einfache Klassifikation reicht oft Ministral, für Zusammenfassungen und Agenten lohnt Mistral Small.
Das Modell besteht aus vielen Teilnetzen, den Experten. Ein Router wählt für jedes Token nur wenige davon aus. Dadurch rechnet Mistral Small pro Token nur mit rund sechs Milliarden Parametern und antwortet schnell. Im Speicher müssen aber alle 119 Milliarden Parameter liegen, deshalb braucht die aktuelle Generation GPU Server.
Für die vorige Generation mit 24 Milliarden Parametern ja, sie läuft quantisiert mit Ollama oder llama.cpp auf einer einzelnen GPU. Die aktuelle Generation liefert ihr wegen ihrer Größe besser über vLLM oder SGLang auf GPU Servern bei einem Hoster aus. Für den Laptop ist Ministral mit Ollama die einfachere Wahl.
Das Modell ist ein Werkzeug, DSGVO Konformität hängt am Betrieb. Mit offenen Gewichten könnt ihr es bei einem Hoster in Deutschland oder der EU betreiben, ohne Daten an Anbieter außerhalb Europas zu geben. Auch Mistral selbst hostet in Europa. Zugriffsrechte, Logging und Speicherorte müsst ihr trotzdem regeln.
Wir klären mit euch Aufgabe, Daten und Anforderungen, testen Mistral Small gegen ein kleineres und ein größeres Modell mit anonymisierten Daten und bauen es als Schritt in einen n8n Workflow ein. Am Anfang steht ein kostenloses Kennenlernen, danach rechnen wir transparent nach Minuten ab.