bk99.de entertain the web since 1997

Was ich aus 2,9 Milliarden Token gelernt habe

Zusammenfassung

Im September habe ich KI lokal sprechen lassen, ein 35-Milliarden-Parameter-Modell auf eine einzelne Grafikkarte gebracht und laut OpenAI 2,9 Milliarden Token in der Cloud verbraucht. Ein Geschenk für einen Freund ist trotzdem nicht fertig geworden. Dieser Beitrag zeigt, wo die Wartezeit einer Sprach-KI wirklich steckt, warum ein HTTP 200 lügen kann und was ein Token-Zähler über KI-Agenten verrät.

Mit leeren Händen nach München

Eigentlich hatte ich einen klaren Plan: Zu meinem Treffen mit Thomas in München wollte ich ihm einen neuen DeskHop mitbringen, einen kleinen Umschalter, mit dem Tastatur und Maus zwischen zwei Rechnern wechseln. Ich habe viele Abende und sehr viele Token hineingesteckt, auch mit GPT-6 Astra. Nach München kam ich trotzdem mit leeren Händen.

Dieser Monat war also kein reiner Erfolg. Er hat mir aber gezeigt, wo KI heute wirklich hilft, wo sie Zeit kostet und wo sie an ihre Grenzen kommt. Genau das will ich hier teilen.

Eine Stimme aus wenigen Sekunden

Das eindrucksvollste Experiment war ein kleiner Vorlesebot. Er las mir Meldungen aus dem heise-Newsticker vor, mit den Stimmen von Lucy und David. Als Vorlage genügten ihm wenige Sekunden Sprachaufnahme.

Dahinter steckt OpenVoice. Ein erstes Modell verwandelt den Text in gesprochene Sprache, ein zweites überträgt danach die Klangfarbe aus der kurzen Aufnahme. Weil beide Schritte getrennt sind, muss die Aufnahme nicht einmal in derselben Sprache vorliegen wie der vorgelesene Text.

Was du mitnehmen kannst: Ein paar Sekunden deiner Stimme reichen heute für einen überzeugenden Klon. Jede Sprachnachricht und jedes Video ist damit auch Rohmaterial. Ein vertrauter Klang am Telefon beweist nicht mehr, wer wirklich spricht; ein vereinbartes Rückfragewort in der Familie schon eher.

Warum GLaDOS 22 Sekunden brauchte

Die zweite Stimme ist die deutsche GLaDOS, ein frei verfügbares Piper-Modell. Damit habe ich mir einen Sprachchat gebaut, der vollständig zu Hause läuft: Whisper macht aus meiner Frage Text, Gemma 3 formuliert die Antwort, Piper spricht sie aus. Kein Audio verlässt das Haus.

Beim ersten Test kam die Antwort erst nach fast 22 Sekunden. Das Modell war nicht zu langsam. Es wartete: Meine Dokumentenverarbeitung nutzte dieselbe Grafikkarte mit einer anderen Kontextgröße, und die Anfragen standen Schlange. Mit zwei parallelen Plätzen in Ollama und einer einheitlichen Kontextgröße kam der erste Text nach 1,6 Sekunden. Die Sprachausgabe selbst beschleunigte ein einziger Wert: Mit acht statt einem Rechenthread sank sie für einen kurzen Satz von 3,1 auf 0,7 Sekunden.

Was du mitnehmen kannst: Miss bei Sprachassistenten die Zeit bis zum ersten Wort. Wenn sie schlecht ist, suche zuerst nach geteilten Ressourcen, bevor du ein schnelleres Modell kaufst.

Ein großes Modell auf einer kleinen Karte

Für längere Texte habe ich Qwen3.6-35B auf eine RTX 5070 Ti mit 16 GB Grafikspeicher gebracht. Das klingt unmöglich, funktioniert aber, weil es ein Mixture-of-Experts-Modell ist: Für jedes Token rechnet nur ein kleiner Teil des Netzes, die übrigen Experten warten im normalen Arbeitsspeicher. So verarbeitete das System in meinem Test gut 18.000 Token Eingabe in knapp acht Sekunden.

Die wichtigste Lektion kam aus einem Fehler. Zu lange Anfragen beantwortete der Server mit dem Status 200, also „alles in Ordnung“. Die eigentliche Fehlermeldung stand erst im laufenden Datenstrom. Jede Überwachung, die nur auf den Status schaut, hätte den Fehler übersehen.

Was du mitnehmen kannst: Ein grünes Licht ist kein Beweis. Prüfe bei KI-Diensten das Ergebnis selbst, nicht nur den Statuscode.

Der Agent, der schwieg

Im Hintergrund arbeitet Hermes, ein KI-Agent, der mir täglich Hacker News und heise zusammenfassen soll. Über den Router Omniroute wählt er dafür automatisch ein passendes Modell bei verschiedenen Anbietern.

Bei einer Prüfung stellte sich heraus, dass keiner seiner sechs Zeitaufträge mehr durchlief. Der Agent selbst war erreichbar und sah gesund aus. Jeder Auftrag scheiterte aber schon beim Start, weil der Scheduler einen systemd-Scope anlegen wollte, den es in seiner Umgebung nicht gab. Die Zusammenfassungen blieben einfach aus.

Was du mitnehmen kannst: Überwache bei Automatisierungen das Ergebnis, zum Beispiel „Ist heute eine Zusammenfassung angekommen?“, und nicht nur, ob der Dienst läuft.

Was 2,9 Milliarden Token wirklich bedeuten

Die größte Zahl des Monats zeigt das OpenAI-Webinterface: 2,9 Milliarden Token im September. Für 1,31 Milliarden davon konnte ich die Protokolle von Codex auf meinem Administrationsrechner auswerten. Das Ergebnis hat mich überrascht.

Nur 0,35 Prozent davon waren Antworten der KI. Fast alles andere war Eingabe, und 94,5 Prozent dieser Eingabe kamen aus dem Zwischenspeicher. Ein Agent liest bei jedem Arbeitsschritt seinen gesamten Kontext neu: Dateien, Protokolle, den bisherigen Verlauf. Milliarden Token heißen also nicht Milliarden geschriebene Wörter, sondern Milliarden Mal wiedergelesener Kontext.

Was du mitnehmen kannst: Bei Agenten bestimmen Kontextgröße und Caching Kosten und Tempo. Kleine, klar abgegrenzte Aufgaben sind deshalb günstiger als ein Agent, der ständig alles mitliest.

Warum der DeskHop trotzdem nicht fertig wurde

Zurück zum Geschenk für Thomas. Meine Variante hDeskHop sollte statt fertiger Controller-Boards zwei direkt bestückte RP2040 nutzen und schon mit einem einzigen angeschlossenen Rechner funktionieren. Jede Seite hat ihre eigene Masse und versorgt die andere über einen galvanisch getrennten Zweig.

Digital ist der Entwurf fertig: 221 Bauteile auf 62 mal 72 Millimetern, null Fehler in den Prüfungen von KiCad, eine Firmware, die baut und ihre Tests besteht. Mein eigentliches Ziel war aber ein Gerät, das ähnlich günstig ist wie der Original-Eigenbau. Allein die Bauteile kosten rund 53 US-Dollar, einzelne Teile waren nicht in ausreichender Menge lieferbar, und die Stromreserven sind nur gerechnet, nicht gemessen. Ein Erstmuster wurde nie gefertigt.

Was du mitnehmen kannst: KI kann Schaltpläne, Layouts und Firmware in erstaunlichem Tempo erzeugen. Bauteile bestellen, löten und messen kann sie nicht. Lege Kostenziel und erstes Erstmuster deshalb früh fest, bevor die nächste Milliarde Token in den Feinschliff fließt.

Zahlen im Überblick

  • OpenVoice steht seit April 2024 in Version 1 und 2 unter der MIT-Lizenz.
  • Die deutsche GLaDOS-Stimme ist ein frei verfügbares Piper-Modell mit rund 114 MB.
  • Qwen3.6-35B-A3B im NVFP4-Format umfasst rund 23,5 GB Modelldateien und verarbeitete in meinem Test 18.249 Eingabetoken in 7,7 Sekunden.
  • Von 1,31 Milliarden ausgewerteten Codex-Token im September waren 4,5 Millionen Ausgabe.
  • Der hDeskHop-Entwurf braucht 57 verschiedene Herstellerteile.

Referenzen

Bemerkungen

  • Alle Zeiten sind Einzelmessungen auf meiner Hardware und kein allgemeiner Leistungsvergleich.

OpenVoice auf GitHub ansehen