Längere Generierung durch quantisierten KV-Cache
Zusammenfassung
Der Beitrag quantisiert den Key-Value-Cache, der bei langen Kontexten einen wachsenden Teil des GPU-Speichers belegt. Damit bleibt mehr Speicher für längere Sequenzen oder größere Stapel frei. Der KV-Cache wächst mit Sequenzlänge, Schichtzahl und Stapelgröße.
Ideen
- Bei autoregressiver Generierung kann der Zustands-Cache wichtiger werden als die Modellgewichte.
- Cache-Quantisierung tauscht Erinnerungsgenauigkeit gegen Kontextkapazität.
Fakten
- Der KV-Cache wächst mit Sequenzlänge, Schichtzahl und Stapelgröße.
- Transformers unterstützt quantisierte Cache-Implementierungen für ausgewählte Backends.
Kritik
- Zusätzliche Quantisierungsschritte können kurze Anfragen verlangsamen und subtile Fehler einführen.
Empfehlungen
- Teste lange Kontexte auf Qualitätsabfall und miss, ab welcher Länge Quantisierung tatsächlich hilft.
Referenzen
Originalbeitrag auf Hugging Face lesen →
Links zur Originalquelle und zum Webarchiv öffnen einen neuen Tab.