Kolibri: Ein souveränes deutsches Sprachmodell mit offenen Gewichten
Zusammenfassung
Aleph Alpha veröffentlichte am Tag der Deutschen Einheit 2026 Kolibri, ein Sprachmodell für Deutsch und Englisch mit offenen Gewichten unter der Apache-2.0-Lizenz. Das Mixture-of-Experts-Modell hat 78 Milliarden Parameter, von denen pro Token rund 3,5 Milliarden rechnen, und verarbeitet bis zu eine Million Token Kontext. Es ist für Verwaltung, Industrie und Luftfahrt gedacht, die Modelle auf eigenen Servern betreiben und nachvollziehen wollen.
Was ist Kolibri?
Kolibri ist ein großes Sprachmodell des Heidelberger Unternehmens Aleph Alpha, trainiert von Grund auf in Deutschland und Finnland. Es ist ein Mixture-of-Experts-Modell: Jede seiner 50 Schichten enthält 384 kleine Teilnetze, die Experten, und ein Router wählt für jedes Token sechs davon aus, dazu einen gemeinsamen Experten. So rechnet das Modell wie ein kleines, braucht aber den Speicher eines großen, denn alle Experten müssen geladen sein.
Die Gewichte stehen auf Hugging Face. Aleph Alpha behält die Rechte am Trainingscode, die Gewichte und Konfigurationsdateien dürfen nach Apache 2.0 frei genutzt werden.
Was „souverän“ hier bedeutet
Aleph Alpha meint damit zweierlei. Zum einen die Herkunft: entwickelt und trainiert unter europäischem und deutschem Recht, mit nachvollziehbarer Lieferkette von den Trainingsdaten bis zur Bewertung. Zum anderen die Nutzung: Eine Behörde oder ein Zulieferer kann das Modell im eigenen Rechenzentrum betreiben, ohne Daten an einen fremden Dienst zu schicken, und niemand kann es von außen ändern oder abschalten.
Souverän heißt allerdings nicht, dass nichts von außerhalb Europas eingeflossen ist. Laut Modellkarte wurden Trainingstexte mit Gemma 4 und Mistral-NeMo umformuliert, und Qwen3-32B half bei der Qualitätsfilterung.
Warum Deutsch hier mehr ist als eine Übersetzung
Rund 21 Prozent der Trainingsdaten sind deutsch, Übersetzungen machen nur 6 Prozent aus. Der eigene Tokenizer zerlegt deutsche Komposita deutlich seltener: „Bundesverfassungsgericht“ sind für Kolibri zwei Token, für den Tokenizer von GPT-5 sechs. Weniger Token bedeuten weniger Rechenschritte und mehr deutschen Text im selben Kontextfenster. Außerdem denkt das Modell bei deutschen Fragen auch auf Deutsch nach, statt intern ins Englische zu wechseln.
Eine weitere Besonderheit: Kolibri wurde gezielt darauf trainiert, „Ich weiß es nicht“ zu sagen, wenn eine Antwort nicht in den bereitgestellten Dokumenten steht. Für Anwendungen, die Antworten aus eigenen Unterlagen erzeugen, ist das wichtiger als ein paar Prozentpunkte in einem Benchmark.
Ideen
- Mixture-of-Experts senkt den Rechenaufwand pro Token, nicht aber den Speicherbedarf.
- Ein Tokenizer für deutsche Komposita spart Rechenzeit und Kontext.
- Ein Modell kann darauf trainiert werden, fehlende Belege zuzugeben.
- Offene Gewichte erlauben Betrieb ohne fremde Cloud-Dienste.
Einsichten
- Souveränität bei KI betrifft Herkunft, Betrieb und Nachvollziehbarkeit, nicht nur den Firmensitz.
- Sprachspezifisches Training verbessert ein Modell an Stellen, die allgemeine Benchmarks kaum zeigen.
Fakten
- Kolibri hat 78,1 Milliarden Parameter, davon rund 3,5 Milliarden aktiv pro Token.
- Der Kontext umfasst nativ 262.144 Token und wurde bis 1.048.576 Token geprüft.
- Trainiert wurde mit rund 24 Billionen Token auf 768 NVIDIA-B200-GPUs.
- Auf Hacker News erreichte die Meldung am 3. Oktober 2026 704 Punkte.
Referenzen
- Aleph Alpha: Kolibri Has Landed: A Sovereign Open-Weight Model
- Tejas Kumar: Aleph Alpha Kolibri: How the Sovereign German LLM Works
Kritik
- Die Benchmark-Vergleiche stammen von Aleph Alpha selbst; unabhängige Messungen standen zur Veröffentlichung erst am Anfang.
- Mit rund 78 GB Gewichten in FP8 passt Kolibri nicht auf übliche Grafikkarten für Zuhause, ohne Experten in den Arbeitsspeicher auszulagern.
Bemerkungen
- Die Analyse von Tejas Kumar wertet den 189-seitigen Tech-Report aus und prüft den Tokenizer selbst am Grundgesetz.
Empfehlungen
- Teste Kolibri mit deinen eigenen deutschen Dokumenten statt nur mit Benchmarks.
- Plane für den lokalen Betrieb genug Arbeits- oder Grafikspeicher für alle 78 Milliarden Parameter ein.
- Prüfe bei Antworten aus Dokumenten, ob das Modell fehlende Belege tatsächlich zugibt.
Links zur Originalquelle und zum Webarchiv öffnen einen neuen Tab.