bk99.de entertain the web since 1997

Längere Generierung durch quantisierten KV-Cache

Zusammenfassung

Der Beitrag quantisiert den Key-Value-Cache, der bei langen Kontexten einen wachsenden Teil des GPU-Speichers belegt. Damit bleibt mehr Speicher für längere Sequenzen oder größere Stapel frei. Der KV-Cache wächst mit Sequenzlänge, Schichtzahl und Stapelgröße.

Ideen

  • Bei autoregressiver Generierung kann der Zustands-Cache wichtiger werden als die Modellgewichte.
  • Cache-Quantisierung tauscht Erinnerungsgenauigkeit gegen Kontextkapazität.

Fakten

  • Der KV-Cache wächst mit Sequenzlänge, Schichtzahl und Stapelgröße.
  • Transformers unterstützt quantisierte Cache-Implementierungen für ausgewählte Backends.

Kritik

  • Zusätzliche Quantisierungsschritte können kurze Anfragen verlangsamen und subtile Fehler einführen.

Empfehlungen

  • Teste lange Kontexte auf Qualitätsabfall und miss, ab welcher Länge Quantisierung tatsächlich hilft.

Referenzen

Originalbeitrag auf Hugging Face lesen →

Im Webarchiv suchen