NCA Social Media
Aktualisiert:
Autor:
Roland Golla
Grüner Kolibri mit Fahne über der Hand einer Frau im Matrix Look

Was ist Aleph Alpha Kolibri?

Aleph Alpha Kolibri ist ein Open Weight Sprachmodell des Heidelberger KI Unternehmens Aleph Alpha für Deutsch und Englisch. Das Mixture of Experts Modell hat rund 78 Milliarden Parameter, von denen pro Token nur etwa 3,5 Milliarden arbeiten, und steht unter der Lizenz Apache 2.0.

Kolibri ist ein Reasoning Modell mit Tool Calling und sehr langem Kontext. Es ist kein Coding Modell, sondern ein Allzweckmodell für Verwaltung, Industrie und Luftfahrt. Gemeint sind Organisationen, die ihre Daten nicht an Cloud Dienste aus den USA oder China geben wollen.

Der Name passt. Ein Kolibri ist klein und schnell. Genau das ist die Idee hinter dem Modell: viel Wissen im Speicher, aber wenig Rechenarbeit pro Antwort.

Inhalt

Mit NCA ordnest du Kolibri für dein Unternehmen richtig ein

Kolibri ist nicht Teil unseres eigenen Stacks. Wir kennen aber die Fragen, die bei so einem Modell zählen. Wir betreiben kleine Modelle lokal mit Ollama, holen große Modelle über EU Anbieter und hosten auf eigenen Servern in Deutschland mit unserem Netzwerkpartner Conversis in Duisburg. Daher wissen wir, was ein Modell dieser Größe im Betrieb wirklich braucht.

Wir helfen Teams, Kolibri gegen andere Optionen abzuwägen und sauber einzubinden. Dazu gehören Self Hosted KI für Unternehmen, KI Assistenten selbst hosten, die NCA MCP Middleware für Unternehmensdaten, die DSGVO Beratung für KI Projekte und eine passende KI Strategie für Unternehmen.

NCA KI Workshop für Unternehmen

KI gemeinsam im Team verankern

Der NCA KI Workshop gibt eurem Team einen gemeinsamen Rahmen für KI. Workshoptag inhouse, optional mit Praxistag, als Variante für Developer oder alle Abteilungen.

  1. 1
    Kostenloses Vorgespräch
    Ziele und Teilnehmer klären
  2. 2
    Variante wählen
    Developer oder alle Abteilungen
  3. 3
    Workshoptag bei euch
    Ein Tag inhouse, danach bleibt ein Rahmen
Roland Golla
Roland Golla
Fullstack Developer
Workshop Varianten ansehen arrow_forward

Was Kolibri kann

Laut Modellkarte auf Hugging Face bringt Kolibri diese Eigenschaften mit:

  • Zwei Sprachen: Deutsch und Englisch, mit einem Tokenizer, der auf deutsche Wortstrukturen angepasst ist.
  • Reasoning Modus: Das Modell kann vor der Antwort in Zwischenschritten nachdenken.
  • Tool Calling: Kolibri ruft strukturiert Werkzeuge auf und eignet sich damit für Agenten.
  • Langer Kontext: Bis zu rund einer Million Tokens. Aleph Alpha empfiehlt für den Betrieb höchstens 262.144 Tokens, das ist auch die native Kontextlänge.
  • Offene Gewichte: Lizenz Apache 2.0 für Gewichte und Konfiguration.

Der lange Kontext macht Kolibri spannend für Aufgaben mit vielen Dokumenten, etwa Akten, Handbücher oder technische Spezifikationen. Wer Wissen aus eigenen Dokumenten abfragen will, kombiniert das oft mit RAG. Mehr dazu steht bei unseren Embedding Modellen für RAG.

Architektur und Hardware von Kolibri

Kolibri ist ein Mixture of Experts Modell. Es besteht aus vielen Teilnetzen, und ein Router wählt pro Token nur wenige davon aus. Von rund 78 Milliarden Parametern sind so nur etwa 3,5 Milliarden aktiv. Das hält Antworten schnell und die Kosten im Betrieb niedrig.

Im Speicher liegen müssen trotzdem alle Gewichte. In der FP8 Fassung braucht Kolibri laut Modellkarte rund 78 GB. Für den Betrieb nennt Aleph Alpha eine H200 oder B200 GPU oder zwei H100 GPUs. Ausgeliefert wird das Modell über vLLM mit einem eigenen Plugin von Aleph Alpha.

Kurz gesagt: Kolibri gehört auf GPU Server bei einem Hoster, nicht auf den Laptop. Sinnvoll ist ein Anbieter in Deutschland oder der EU, etwa TensorX, als Enterprise Option auch Conversis. Wie sich Modelle für kleinere Hardware schrumpfen lassen, erklärt unsere Seite zur GGUF Quantisierung.

Weniger Halluzinationen durch das Merlin Arthur Verfahren

Ein Kernthema bei Kolibri ist Zuverlässigkeit. Aleph Alpha hat das Modell mit Beispielen trainiert, in denen die richtige Antwort lautet: Dazu fehlen die Belege. Dazu kommt ein eigenes Verfahren namens Merlin Arthur, das mit synthetisch erzeugten positiven und negativen Beispielen arbeitet.

Das Ziel ist ein Modell, das lieber nichts sagt als etwas Falsches. Nach Angaben von Aleph Alpha vermeidet Kolibri bei einem Wissenstest deutlich häufiger falsche Antworten als sein Vorgänger Kolibri Origin. Für Behörden und regulierte Branchen ist das wichtiger als der letzte Punkt im Benchmark.

Eine Garantie ist das nicht. Auch Kolibri kann Fehler machen. Ausgaben in kritischen Prozessen brauchen weiterhin Prüfung durch Menschen und klare Quellen.

Kolibri im Vergleich mit Qwen, Nemotron und Mistral

Aleph Alpha vergleicht Kolibri in den eigenen Benchmarks mit anderen offenen Mixture of Experts Modellen. Die wichtigsten Gegner sind Qwen3.6 35B A3B von Alibaba, Nemotron 3 Super von NVIDIA und Mistral Small 4 aus Frankreich. In diesem Feld schneidet Kolibri gut ab, vor allem auf Deutsch und beim Verhältnis von Qualität zu Betriebskosten.

Die Tabelle zeigt die Größenordnung der Modelle. Die Zahlen stammen aus den Modellnamen und der Modellkarte von Kolibri.

Kolibri und vergleichbare Open Weight Modelle

Modell Hersteller und Herkunft Parameter gesamt und aktiv pro Token
Kolibri Aleph Alpha, Deutschland 78 Milliarden, davon rund 3,5 Milliarden aktiv
Qwen3.6 35B A3B Alibaba Qwen, China 35 Milliarden, davon rund 3 Milliarden aktiv
Nemotron 3 Super NVIDIA, USA 120 Milliarden, davon rund 12 Milliarden aktiv
Mistral Small 4 Mistral AI, Frankreich 119 Milliarden, davon rund 6 Milliarden aktiv

Warum Benchmarks bei Kolibri nur die halbe Wahrheit sind

Unabhängige Stimmen sehen Kolibri klar hinter der Spitze der offenen Modelle. Wer nur auf Ranglisten schaut, findet stärkere Kandidaten, etwa große Modelle aus China. Aleph Alpha hält dagegen, dass öffentliche Benchmarks die Aufgaben der eigenen Kunden schlecht abbilden.

Beide Seiten haben einen Punkt. Für ein Team, das das beste Modell aus der Cloud will, ist Kolibri selten die erste Wahl. Für eine Behörde, die ein Modell aus Deutschland braucht, das nach europäischem Recht entwickelt wurde und bei einem deutschen Hoster läuft, sieht die Rechnung anders aus.

Unser Rat ist deshalb immer derselbe: Teste zwei oder drei Modelle mit deinen eigenen Aufgaben auf Deutsch. Ein kleiner Praxistest mit anonymisierten Daten sagt mehr als jede Rangliste. Wie du das ohne Anbieter aus den USA angehst, zeigt unser Guide Welches KI Modell ohne US Anbieter.

Was die Fusion mit Cohere für Kolibri bedeutet

Aleph Alpha und das kanadische KI Unternehmen Cohere haben ihre Fusion vereinbart. Heidelberg soll als Forschungsstandort erhalten bleiben. Kolibri ist damit eines der ersten großen Modelle, das aus dieser neuen Konstellation kommt.

Für Nutzer ist ein Punkt wichtig: Die Gewichte stehen unter Apache 2.0 und liegen offen. Wer Kolibri heute lädt, kann es weiter betreiben, auch wenn sich Produktnamen oder Strategien beim Hersteller ändern. Genau das ist der Vorteil offener Gewichte gegenüber einer reinen API. Mehr zu diesem Gedanken steht bei Digitaler Souveränität für Entwickler.

Für wen Kolibri passt und für wen nicht

Kolibri passt gut, wenn diese Punkte auf dich zutreffen:

  • Du arbeitest in Verwaltung, Industrie oder einer regulierten Branche.
  • Deine Texte und Dokumente sind vor allem auf Deutsch.
  • Das Modell soll bei einem Hoster in Deutschland oder der EU laufen.
  • Du brauchst lange Kontexte und ein Modell, das bei fehlenden Belegen eher schweigt.

Kolibri passt weniger, wenn du diese Ziele hast:

  • Du suchst das stärkste Modell, egal woher es kommt.
  • Du willst ein Modell lokal auf dem Laptop betreiben.
  • Du brauchst ein Spezialmodell fürs Programmieren. Dafür sind die Vibe Coding Modelle die bessere Adresse.
  • Du brauchst viele Sprachen außer Deutsch und Englisch.

Eine Alternative aus Deutschland mit anderem Ansatz ist Soofi S. Einen Blick auf europäische Modelle aus Frankreich bietet unser Vergleich ChatGPT und Mistral.

Small bird, fast wings, Kolibri is here.

Aleph Alpha, Ankündigung zum Release von Kolibri – via TestingCatalog

Wie wir Teams bei souveränen KI Modellen begleiten

Bei Modellen wie Kolibri entscheidet selten das Modell allein. Wichtiger sind die Fragen drumherum. Welche Daten sollen verarbeitet werden? Wo läuft das Modell? Wer hat Zugriff? Und wie tauschst du das Modell später aus, wenn ein besseres kommt?

Wir helfen Teams dabei in klaren Schritten:

  • Bedarf klären: Aufgabe, Datenarten und Anforderungen aus DSGVO und AI Act.
  • Modelle testen: Kolibri gegen zwei oder drei Alternativen, mit anonymisierten Daten.
  • Betrieb planen: Hoster in Deutschland oder EU Anbieter, sensible Daten bleiben im eigenen Netzwerk.
  • Austauschbar bauen: mit einem LLM Gateway wie LiteLLM, damit das Modell später leicht wechselt.

Für den Einstieg helfen unsere Seiten zu AI Readiness und zu Langfuse für LLM Observability. Wer das Thema im ganzen Unternehmen verankern will, findet den passenden Rahmen im NCA KI Workshop für Unternehmen. Am Anfang steht ein kostenloses Kennenlernen, abgerechnet wird transparent nach Minuten.

CYPRESS.IO Ambassador und IT Consultant für QA Engenieering und Qualität in PHP Projekten.
NCA Vibe Coding Consulting

Roland Golla ist Entwickler aus Leidenschaft – seit über 20 Jahren. Er hat hunderte Projekte begleitet, von Legacy-Refactoring bis KI-Integration. Bei Vibe Coding verbindet er das Beste aus beiden Welten: Die Geschwindigkeit von KI-generiertem Code mit der Qualität professioneller Softwareentwicklung. Kein Bullshit, keine Agentur-Floskeln – direkte Hilfe von jemandem, der selbst täglich im Code steckt.

Häufige Fragen zu Aleph Alpha Kolibri

Hier beantworten wir die wichtigsten Fragen zu Kolibri, seiner Hardware, der Lizenz und dem Einsatz im Unternehmen.

Was ist Aleph Alpha Kolibri 2026?

Kolibri ist ein Open Weight Sprachmodell von Aleph Alpha aus Heidelberg für Deutsch und Englisch. Es ist ein Mixture of Experts Modell mit rund 78 Milliarden Parametern, von denen pro Token nur etwa 3,5 Milliarden arbeiten. Das Modell kann schrittweise schlussfolgern, Werkzeuge aufrufen und sehr lange Texte verarbeiten.

Ist Kolibri 2026 kostenlos nutzbar?

Ja, die Gewichte stehen unter der Lizenz Apache 2.0 auf Hugging Face. Damit darfst du Kolibri auch kommerziell nutzen und anpassen. Kosten entstehen trotzdem, und zwar für Hosting und Betrieb. Ein Modell dieser Größe braucht starke GPU Server, die du bei einem Hoster in Deutschland oder der EU mietest. Das ist der eigentliche Kostenfaktor.

Welche Hardware braucht Kolibri 2026?

Laut Aleph Alpha braucht Kolibri in der FP8 Fassung rund 78 GB Speicher. Für den Betrieb nennt der Hersteller eine H200 oder B200 GPU oder zwei H100 GPUs. Ausgeliefert wird das Modell über vLLM mit einem eigenen Plugin. Auf einem normalen Laptop oder Desktop Rechner läuft Kolibri nicht sinnvoll.

Ist Kolibri 2026 ein Coding Modell?

Nein. Kolibri ist ein Allzweckmodell für Texte, Wissen, Reasoning und Agenten. Es schneidet in Coding Tests ordentlich ab, ist darauf aber nicht spezialisiert. Aleph Alpha zielt mit Kolibri auf Verwaltung, Industrie und Luftfahrt. Wer ein Modell vor allem fürs Programmieren sucht, findet bei den Vibe Coding Modellen passendere Kandidaten.

Wie gut ist Kolibri 2026 im Vergleich zu anderen Modellen?

In den eigenen Benchmarks von Aleph Alpha liegt Kolibri gut im Feld vergleichbarer offener Modelle wie Qwen3.6 35B A3B, Nemotron 3 Super und Mistral Small 4, vor allem auf Deutsch. Unabhängige Stimmen sehen es aber klar hinter der Spitze der offenen Modelle. Die Stärke liegt eher bei Souveränität und Betriebskosten.

Was bedeutet Mixture of Experts bei Kolibri?

Kolibri besteht aus vielen spezialisierten Teilnetzen. Ein Router wählt für jedes Token nur wenige davon aus. So arbeiten pro Token nur rund 3,5 von 78 Milliarden Parametern. Das macht Antworten schnell und günstig. Im Speicher liegen müssen trotzdem alle Gewichte, daher bleibt der Bedarf an Grafikspeicher hoch.

Wie lang darf der Kontext bei Kolibri sein?

Kolibri verarbeitet laut Modellkarte bis zu rund einer Million Tokens. Die native Kontextlänge liegt bei 262.144 Tokens, und Aleph Alpha empfiehlt, im Betrieb bei diesem Wert zu bleiben. Das reicht für sehr lange Dokumente, Akten oder ganze Handbücher in einem einzigen Durchgang.

Was ist das Merlin Arthur Verfahren?

Merlin Arthur ist ein Trainingsverfahren von Aleph Alpha, das mit synthetisch erzeugten positiven und negativen Beispielen arbeitet. Zusammen mit gezielten Beispielen zum Verzicht auf Antworten soll es Kolibri beibringen, lieber nichts zu sagen, wenn Belege fehlen. Das Ziel sind weniger Halluzinationen in kritischen Anwendungen.

Ist Kolibri DSGVO konform?

Das Modell selbst ist ein Werkzeug, DSGVO Konformität hängt am Betrieb. Weil die Gewichte offen sind, kannst du Kolibri bei einem Hoster in Deutschland oder der EU betreiben, ohne Daten an Anbieter aus den USA oder China zu geben. Zugriffsrechte, Logging und Speicherorte musst du trotzdem sauber regeln und dokumentieren.

Was ist der Unterschied zwischen Kolibri und Kolibri Origin?

Kolibri Origin ist der kleinere Vorgänger mit rund 30 Milliarden Parametern und kürzerem Kontext. Kolibri ist größer, verarbeitet deutlich längere Texte und wurde zusätzlich darauf trainiert, bei fehlenden Belegen auf eine Antwort zu verzichten. Nach Angaben von Aleph Alpha vermeidet es dadurch deutlich häufiger falsche Antworten.

Was ändert die Fusion von Aleph Alpha und Cohere an Kolibri?

Für bestehende Nutzer zunächst wenig. Die Gewichte stehen unter Apache 2.0 offen zur Verfügung und können weiter betrieben werden, auch wenn sich beim Hersteller Namen oder Strategien ändern. Ob und wie Kolibri weiterentwickelt wird, hängt von der künftigen Ausrichtung des gemeinsamen Unternehmens ab.

Wie hilft NCA beim Einsatz von Kolibri?

Wir klären mit dir Aufgabe, Daten und Anforderungen, testen Kolibri gegen passende Alternativen mit anonymisierten Daten und planen den Betrieb bei einem Hoster in Deutschland oder einem EU Anbieter. Am Anfang steht ein kostenloses Kennenlernen, danach schätzen wir den Aufwand und rechnen transparent nach Minuten ab.