Soofi S ist das souveräne Open Source KI Modell des deutschen Soofi Konsortiums. Architektur, Benchmarks, Lizenz und ehrliche Praxiseinordnung 2026.
Mehr erfahren
Aleph Alpha Kolibri ist ein Open Weight Sprachmodell des Heidelberger KI Unternehmens Aleph Alpha für Deutsch und Englisch. Das Mixture of Experts Modell hat rund 78 Milliarden Parameter, von denen pro Token nur etwa 3,5 Milliarden arbeiten, und steht unter der Lizenz Apache 2.0.
Kolibri ist ein Reasoning Modell mit Tool Calling und sehr langem Kontext. Es ist kein Coding Modell, sondern ein Allzweckmodell für Verwaltung, Industrie und Luftfahrt. Gemeint sind Organisationen, die ihre Daten nicht an Cloud Dienste aus den USA oder China geben wollen.
Der Name passt. Ein Kolibri ist klein und schnell. Genau das ist die Idee hinter dem Modell: viel Wissen im Speicher, aber wenig Rechenarbeit pro Antwort.
Kolibri ist nicht Teil unseres eigenen Stacks. Wir kennen aber die Fragen, die bei so einem Modell zählen. Wir betreiben kleine Modelle lokal mit Ollama, holen große Modelle über EU Anbieter und hosten auf eigenen Servern in Deutschland mit unserem Netzwerkpartner Conversis in Duisburg. Daher wissen wir, was ein Modell dieser Größe im Betrieb wirklich braucht.
Wir helfen Teams, Kolibri gegen andere Optionen abzuwägen und sauber einzubinden. Dazu gehören Self Hosted KI für Unternehmen, KI Assistenten selbst hosten, die NCA MCP Middleware für Unternehmensdaten, die DSGVO Beratung für KI Projekte und eine passende KI Strategie für Unternehmen.
Der NCA KI Workshop gibt eurem Team einen gemeinsamen Rahmen für KI. Workshoptag inhouse, optional mit Praxistag, als Variante für Developer oder alle Abteilungen.
Laut Modellkarte auf Hugging Face bringt Kolibri diese Eigenschaften mit:
Der lange Kontext macht Kolibri spannend für Aufgaben mit vielen Dokumenten, etwa Akten, Handbücher oder technische Spezifikationen. Wer Wissen aus eigenen Dokumenten abfragen will, kombiniert das oft mit RAG. Mehr dazu steht bei unseren Embedding Modellen für RAG.
Kolibri ist ein Mixture of Experts Modell. Es besteht aus vielen Teilnetzen, und ein Router wählt pro Token nur wenige davon aus. Von rund 78 Milliarden Parametern sind so nur etwa 3,5 Milliarden aktiv. Das hält Antworten schnell und die Kosten im Betrieb niedrig.
Im Speicher liegen müssen trotzdem alle Gewichte. In der FP8 Fassung braucht Kolibri laut Modellkarte rund 78 GB. Für den Betrieb nennt Aleph Alpha eine H200 oder B200 GPU oder zwei H100 GPUs. Ausgeliefert wird das Modell über vLLM mit einem eigenen Plugin von Aleph Alpha.
Kurz gesagt: Kolibri gehört auf GPU Server bei einem Hoster, nicht auf den Laptop. Sinnvoll ist ein Anbieter in Deutschland oder der EU, etwa TensorX, als Enterprise Option auch Conversis. Wie sich Modelle für kleinere Hardware schrumpfen lassen, erklärt unsere Seite zur GGUF Quantisierung.
Ein Kernthema bei Kolibri ist Zuverlässigkeit. Aleph Alpha hat das Modell mit Beispielen trainiert, in denen die richtige Antwort lautet: Dazu fehlen die Belege. Dazu kommt ein eigenes Verfahren namens Merlin Arthur, das mit synthetisch erzeugten positiven und negativen Beispielen arbeitet.
Das Ziel ist ein Modell, das lieber nichts sagt als etwas Falsches. Nach Angaben von Aleph Alpha vermeidet Kolibri bei einem Wissenstest deutlich häufiger falsche Antworten als sein Vorgänger Kolibri Origin. Für Behörden und regulierte Branchen ist das wichtiger als der letzte Punkt im Benchmark.
Eine Garantie ist das nicht. Auch Kolibri kann Fehler machen. Ausgaben in kritischen Prozessen brauchen weiterhin Prüfung durch Menschen und klare Quellen.
Aleph Alpha vergleicht Kolibri in den eigenen Benchmarks mit anderen offenen Mixture of Experts Modellen. Die wichtigsten Gegner sind Qwen3.6 35B A3B von Alibaba, Nemotron 3 Super von NVIDIA und Mistral Small 4 aus Frankreich. In diesem Feld schneidet Kolibri gut ab, vor allem auf Deutsch und beim Verhältnis von Qualität zu Betriebskosten.
Die Tabelle zeigt die Größenordnung der Modelle. Die Zahlen stammen aus den Modellnamen und der Modellkarte von Kolibri.
Unabhängige Stimmen sehen Kolibri klar hinter der Spitze der offenen Modelle. Wer nur auf Ranglisten schaut, findet stärkere Kandidaten, etwa große Modelle aus China. Aleph Alpha hält dagegen, dass öffentliche Benchmarks die Aufgaben der eigenen Kunden schlecht abbilden.
Beide Seiten haben einen Punkt. Für ein Team, das das beste Modell aus der Cloud will, ist Kolibri selten die erste Wahl. Für eine Behörde, die ein Modell aus Deutschland braucht, das nach europäischem Recht entwickelt wurde und bei einem deutschen Hoster läuft, sieht die Rechnung anders aus.
Unser Rat ist deshalb immer derselbe: Teste zwei oder drei Modelle mit deinen eigenen Aufgaben auf Deutsch. Ein kleiner Praxistest mit anonymisierten Daten sagt mehr als jede Rangliste. Wie du das ohne Anbieter aus den USA angehst, zeigt unser Guide Welches KI Modell ohne US Anbieter.
Aleph Alpha und das kanadische KI Unternehmen Cohere haben ihre Fusion vereinbart. Heidelberg soll als Forschungsstandort erhalten bleiben. Kolibri ist damit eines der ersten großen Modelle, das aus dieser neuen Konstellation kommt.
Für Nutzer ist ein Punkt wichtig: Die Gewichte stehen unter Apache 2.0 und liegen offen. Wer Kolibri heute lädt, kann es weiter betreiben, auch wenn sich Produktnamen oder Strategien beim Hersteller ändern. Genau das ist der Vorteil offener Gewichte gegenüber einer reinen API. Mehr zu diesem Gedanken steht bei Digitaler Souveränität für Entwickler.
Kolibri passt gut, wenn diese Punkte auf dich zutreffen:
Kolibri passt weniger, wenn du diese Ziele hast:
Eine Alternative aus Deutschland mit anderem Ansatz ist Soofi S. Einen Blick auf europäische Modelle aus Frankreich bietet unser Vergleich ChatGPT und Mistral.
Small bird, fast wings, Kolibri is here.
Soofi S ist das souveräne Open Source KI Modell des deutschen Soofi Konsortiums. Architektur, Benchmarks, Lizenz und ehrliche Praxiseinordnung 2026.
Mehr erfahren
Modell Auswahl ohne US Anbieter: lokale Open Source Modelle, europäische und China Optionen. Praxis Guide mit NCA Stack Empfehlung für 2026.
Mehr erfahrenBei Modellen wie Kolibri entscheidet selten das Modell allein. Wichtiger sind die Fragen drumherum. Welche Daten sollen verarbeitet werden? Wo läuft das Modell? Wer hat Zugriff? Und wie tauschst du das Modell später aus, wenn ein besseres kommt?
Wir helfen Teams dabei in klaren Schritten:
Für den Einstieg helfen unsere Seiten zu AI Readiness und zu Langfuse für LLM Observability. Wer das Thema im ganzen Unternehmen verankern will, findet den passenden Rahmen im NCA KI Workshop für Unternehmen. Am Anfang steht ein kostenloses Kennenlernen, abgerechnet wird transparent nach Minuten.
Roland Golla ist Entwickler aus Leidenschaft – seit über 20 Jahren. Er hat hunderte Projekte begleitet, von Legacy-Refactoring bis KI-Integration. Bei Vibe Coding verbindet er das Beste aus beiden Welten: Die Geschwindigkeit von KI-generiertem Code mit der Qualität professioneller Softwareentwicklung. Kein Bullshit, keine Agentur-Floskeln – direkte Hilfe von jemandem, der selbst täglich im Code steckt.
Hier beantworten wir die wichtigsten Fragen zu Kolibri, seiner Hardware, der Lizenz und dem Einsatz im Unternehmen.
Kolibri ist ein Open Weight Sprachmodell von Aleph Alpha aus Heidelberg für Deutsch und Englisch. Es ist ein Mixture of Experts Modell mit rund 78 Milliarden Parametern, von denen pro Token nur etwa 3,5 Milliarden arbeiten. Das Modell kann schrittweise schlussfolgern, Werkzeuge aufrufen und sehr lange Texte verarbeiten.
Ja, die Gewichte stehen unter der Lizenz Apache 2.0 auf Hugging Face. Damit darfst du Kolibri auch kommerziell nutzen und anpassen. Kosten entstehen trotzdem, und zwar für Hosting und Betrieb. Ein Modell dieser Größe braucht starke GPU Server, die du bei einem Hoster in Deutschland oder der EU mietest. Das ist der eigentliche Kostenfaktor.
Laut Aleph Alpha braucht Kolibri in der FP8 Fassung rund 78 GB Speicher. Für den Betrieb nennt der Hersteller eine H200 oder B200 GPU oder zwei H100 GPUs. Ausgeliefert wird das Modell über vLLM mit einem eigenen Plugin. Auf einem normalen Laptop oder Desktop Rechner läuft Kolibri nicht sinnvoll.
Nein. Kolibri ist ein Allzweckmodell für Texte, Wissen, Reasoning und Agenten. Es schneidet in Coding Tests ordentlich ab, ist darauf aber nicht spezialisiert. Aleph Alpha zielt mit Kolibri auf Verwaltung, Industrie und Luftfahrt. Wer ein Modell vor allem fürs Programmieren sucht, findet bei den Vibe Coding Modellen passendere Kandidaten.
In den eigenen Benchmarks von Aleph Alpha liegt Kolibri gut im Feld vergleichbarer offener Modelle wie Qwen3.6 35B A3B, Nemotron 3 Super und Mistral Small 4, vor allem auf Deutsch. Unabhängige Stimmen sehen es aber klar hinter der Spitze der offenen Modelle. Die Stärke liegt eher bei Souveränität und Betriebskosten.
Kolibri besteht aus vielen spezialisierten Teilnetzen. Ein Router wählt für jedes Token nur wenige davon aus. So arbeiten pro Token nur rund 3,5 von 78 Milliarden Parametern. Das macht Antworten schnell und günstig. Im Speicher liegen müssen trotzdem alle Gewichte, daher bleibt der Bedarf an Grafikspeicher hoch.
Kolibri verarbeitet laut Modellkarte bis zu rund einer Million Tokens. Die native Kontextlänge liegt bei 262.144 Tokens, und Aleph Alpha empfiehlt, im Betrieb bei diesem Wert zu bleiben. Das reicht für sehr lange Dokumente, Akten oder ganze Handbücher in einem einzigen Durchgang.
Merlin Arthur ist ein Trainingsverfahren von Aleph Alpha, das mit synthetisch erzeugten positiven und negativen Beispielen arbeitet. Zusammen mit gezielten Beispielen zum Verzicht auf Antworten soll es Kolibri beibringen, lieber nichts zu sagen, wenn Belege fehlen. Das Ziel sind weniger Halluzinationen in kritischen Anwendungen.
Das Modell selbst ist ein Werkzeug, DSGVO Konformität hängt am Betrieb. Weil die Gewichte offen sind, kannst du Kolibri bei einem Hoster in Deutschland oder der EU betreiben, ohne Daten an Anbieter aus den USA oder China zu geben. Zugriffsrechte, Logging und Speicherorte musst du trotzdem sauber regeln und dokumentieren.
Kolibri Origin ist der kleinere Vorgänger mit rund 30 Milliarden Parametern und kürzerem Kontext. Kolibri ist größer, verarbeitet deutlich längere Texte und wurde zusätzlich darauf trainiert, bei fehlenden Belegen auf eine Antwort zu verzichten. Nach Angaben von Aleph Alpha vermeidet es dadurch deutlich häufiger falsche Antworten.
Für bestehende Nutzer zunächst wenig. Die Gewichte stehen unter Apache 2.0 offen zur Verfügung und können weiter betrieben werden, auch wenn sich beim Hersteller Namen oder Strategien ändern. Ob und wie Kolibri weiterentwickelt wird, hängt von der künftigen Ausrichtung des gemeinsamen Unternehmens ab.
Wir klären mit dir Aufgabe, Daten und Anforderungen, testen Kolibri gegen passende Alternativen mit anonymisierten Daten und planen den Betrieb bei einem Hoster in Deutschland oder einem EU Anbieter. Am Anfang steht ein kostenloses Kennenlernen, danach schätzen wir den Aufwand und rechnen transparent nach Minuten ab.