8-Bit-Matrixmultiplikation für große Transformer
Zusammenfassung
Die Integration von bitsandbytes lädt große Modelle mit 8-Bit-Gewichten und behandelt empfindliche Ausreißer gesondert. Dadurch sinkt der Speicherbedarf, während wichtige numerische Anteile höher präzise bleiben. LLM.int8 kombiniert 8-Bit-Matrixmultiplikation mit höher präziser Behandlung von Ausreißern.
Ideen
- Gemischte Präzision wirkt besser, wenn Ausreißer statt aller Werte teuer verarbeitet werden.
- Quantisierung verschiebt die Grenze dessen, was auf vorhandener Hardware experimentell nutzbar ist.
Einsichten
- Niedrigere Präzision ist eine Systementscheidung zwischen Qualität, Speicher, Kernel und Zielhardware.
Fakten
- LLM.int8 kombiniert 8-Bit-Matrixmultiplikation mit höher präziser Behandlung von Ausreißern.
- Transformers und Accelerate integrieren das Laden quantisierter Modelle.
Kritik
- Die Vorteile hängen von unterstützten GPUs, Operatoren und der Ausreißerverteilung des Modells ab.
Empfehlungen
- Vergleiche Speicher, Durchsatz und Aufgabenqualität gegen eine höher präzise Referenz.
Referenzen
Originalbeitrag auf Hugging Face lesen →
Links zur Originalquelle und zum Webarchiv öffnen einen neuen Tab.