bk99.de entertain the web since 1997

125 Milliarden Parameter auf einer 12-GB-Grafikkarte: Was Strata anders macht

Zusammenfassung

Strata bringt Qwen3.8-Flash-Next, ein Sprachmodell mit 125 Milliarden Parametern, auf einen normalen Spiele-PC mit 12 GB Grafikspeicher und 32 bis 64 GB Arbeitsspeicher. Am 4. Oktober 2026 erschien Version 0.1.39 des erst seit dem 24. September öffentlichen Projekts, das am 5. Oktober bereits rund 11.000 Sterne auf GitHub hatte. Dieser Beitrag erklärt, was Strata ist, wie das technisch funktioniert, wofür man es braucht und wo die Grenzen liegen.

Was ist Strata?

Strata ist eine Inferenz-Engine mit Installer für Windows und Linux, veröffentlicht unter der MIT-Lizenz. Sie lädt ein großes Sprachmodell herunter, startet es auf dem eigenen Rechner und stellt es unter http://127.0.0.1:8080 bereit: im Browser als Chat mit einem Monitor für Grafikkarte, Prozessor und Arbeitsspeicher, für andere Programme als Schnittstelle im Format von OpenAI und Anthropic. Coding-Agenten wie Claude Code oder Codex lassen sich so mit einer geänderten Basis-URL auf das lokale Modell umleiten.

Das Modell dahinter ist Qwen3.8-Flash-Next vom Qwen-Team. Es hat 125 Milliarden Parameter, von denen pro Token nur 6 Milliarden rechnen, dazu kommt eine 51 Milliarden Parameter große N-Gramm-Einbettung. Der Kontext umfasst von Haus aus 262.144 Token. Modelle dieser Größe laufen normalerweise auf Servern mit Hunderten Gigabyte Grafikspeicher.

Wie passt das auf eine kleine Karte?

Der Trick heißt Arbeitsteilung über den ganzen PC. Das Modell besteht aus 24.576 kleinen Spezialisten, den sogenannten Experten, und für jedes Wort werden nur 10 davon gebraucht. Die Grafikkarte übernimmt die Teile, die bei jedem Wort rechnen, und füllt ihren restlichen Speicher mit den am häufigsten gefragten Experten. Welche das sind, lernt Strata während der Nutzung. Alle Experten liegen zusätzlich im Arbeitsspeicher. Fehlt einer auf der Karte, rechnet ihn der Prozessor, gleichzeitig mit der Grafikkarte. Die 28,8 GB große N-Gramm-Tabelle bleibt auf der SSD, pro Wort werden nur wenige Zeilen daraus gelesen.

Dazu kommt das Prinzip „raten, dann prüfen“: Eine kleine, im Modell eingebaute Hilfsschicht schlägt bis zu drei nächste Token vor, und das große Modell prüft alle Vorschläge in einem einzigen Durchgang. Weil das große Modell jedes Wort selbst bestätigt, bleibt die Antwort dieselbe. Sie kommt laut Projekt aber 1,6- bis 1,8-mal schneller.

Das ist die konsequente Fortsetzung dessen, was ich im September mit einem 35-Milliarden-Parameter-Modell auf einer 16-GB-Karte ausprobiert habe, beschrieben in Was ich aus 2,9 Milliarden Token gelernt habe. Bei Mixture-of-Experts-Modellen entscheidet nicht allein die Modellgröße, sondern wie geschickt man die Experten zwischen Grafikkarte, Arbeitsspeicher und SSD verteilt.

Was du mitnehmen kannst: Mehr Grafikspeicher bringt bei solchen Modellen mehr als eine schnellere GPU. Laut Projekt passen pro zusätzlichem Gigabyte rund 700 weitere Experten auf die Karte. Welche Modellgröße überhaupt läuft, entscheidet dagegen der Arbeitsspeicher.

Warum braucht man das?

  • Datenschutz: Prompts, Quellcode und Dokumente verlassen den eigenen Rechner nicht.
  • Kosten: Wer viel mit Agenten arbeitet, verbraucht schnell Milliarden Token, weil der Kontext bei jedem Schritt neu gelesen wird. Lokal kostet jedes Token nur Strom.
  • Unabhängigkeit: Kein Anbieter kann Preise, Limits oder Modellversionen ändern, solange das lokale Modell läuft.
  • Kompatibilität: Vorhandene Werkzeuge brauchen nur eine andere Basis-URL, keinen neuen Code.

Der Mehrwert in Zahlen

Das Projekt hat auf einer RTX 5070 mit 12 GB, einem Ryzen 5 7600 und 64 GB Arbeitsspeicher gemessen. Die schnellste Stufe Q2_0 schreibt 94 Token pro Sekunde, die empfohlene Stufe IQ2_XS 79 und die beste Stufe IQ3_S 53. Lange Eingaben liest Strata mit 1.600 bis 2.650 Token pro Sekunde. Auf einer AMD RX 9070 XT mit 16 GB schreibt Q2_0 60 und IQ2_XS 52 Token pro Sekunde. Zum Vergleich: Ein Token entspricht etwa drei Vierteln eines Wortes, 60 Token pro Sekunde sind schneller, als man mitlesen kann.

Wo die Grenzen liegen

  • Kompression kostet Qualität: Die schnellsten Werte gelten für die am stärksten komprimierten Stufen mit rund 2 Bit pro Gewicht. Nur IQ3_S erreicht laut Projekt auf den veröffentlichten Tests das volle Modell.
  • Die Coder-Variante behält nur 256 der 512 Experten je Schicht, damit sie in 32 GB passt. Die genannten 91 Prozent des SWE-bench-Werts hat nicht Strata gemessen, sie stammen von den Autoren der Variante. Außerhalb von Code ist sie schwächer.
  • Ressourcen: Rund 70 GB Download und etwa 80 GB freier Platz. Beim Start lädt Strata 35 bis 55 GB in den Arbeitsspeicher, der PC kann dabei 1 bis 3 Minuten nicht reagieren.
  • Eine Anfrage zur Zeit ist Standard. Mehrere parallele Anfragen sind möglich, machen auf einer 12-GB-Karte aber jede Antwort langsamer.
  • Installation durch die eigene KI: Das Projekt schlägt vor, einen Coding-Agenten die Einrichtung erledigen zu lassen. Das ist bequem, aber der Agent führt dann fremde Skripte mit deinen Rechten aus. Lies vorher, was setup.sh tut.
  • Netzfreigabe: Mit --host 0.0.0.0 ist Strata im ganzen Netz erreichbar. Dann unbedingt einen API-Schlüssel setzen, wie das Projekt selbst betont.
  • Lizenzen: Strata steht unter der MIT-Lizenz, das Modell unter der Qwen Community License 1.0. Vor gewerblicher Nutzung lohnt ein Blick in deren Bedingungen.
  • Jung und schnell: Das Projekt ist seit dem 24. September 2026 öffentlich und erscheint fast täglich in einer neuen Version. Zahlen und Bedienung können sich rasch ändern.

Was du mitnehmen kannst

  • Vor der Installation rund 80 GB auf einer SSD freimachen und speicherhungrige Programme wie Browser schließen.
  • Mit IQ2_XS beginnen und erst bei genug Arbeitsspeicher auf IQ3_S wechseln.
  • Den Dienst nur mit API-Schlüssel ins Netz freigeben.
  • Lokal und Cloud kombinieren: das lokale Modell für vertrauliche und massenhafte Aufgaben, die Cloud für die schwierigsten Fälle.

Zahlen im Überblick

  • Strata 0.1.39 erschien am 4. Oktober 2026, das Projekt ist seit dem 24. September 2026 öffentlich.
  • Qwen3.8-Flash-Next hat 125 Milliarden Parameter, davon 6 Milliarden aktiv pro Token, dazu 51 Milliarden in der N-Gramm-Einbettung.
  • Das Modell besteht aus 24.576 Experten, pro Token werden 10 davon und ein gemeinsamer Experte genutzt.
  • Mindestens nötig sind 12 GB Grafikspeicher und 32 GB Arbeitsspeicher, mit 64 GB laufen alle Stufen.
  • Unterstützt werden NVIDIA GeForce RTX 20 bis 50 und aktuelle AMD Radeon unter Windows und Linux.

Referenzen

Bemerkungen

  • Alle Geschwindigkeiten sind Messungen des Projekts, keine eigenen Messungen. Strata lief bei mir bisher nicht.

Strata auf GitHub ansehen