bk99.de entertain the web since 1997

LLMs mit AutoGPTQ leichter machen

Zusammenfassung

Die AutoGPTQ-Integration quantisiert bereits trainierte Sprachmodelle auf wenige Bits und bindet sie direkt in Transformers ein. So sinkt der Speicherbedarf für lokale Inferenz erheblich. GPTQ quantisiert Gewichte nach dem Training typischerweise auf vier Bit.

Ideen

  • Post-Training-Quantisierung macht große Modelle zugänglich, ohne sie vollständig neu zu trainieren.
  • Kalibrierungsdaten beeinflussen, welche Gewichte bei niedriger Präzision erhalten bleiben.

Einsichten

  • Niedrigere Präzision ist eine Systementscheidung zwischen Qualität, Speicher, Kernel und Zielhardware.

Fakten

  • GPTQ quantisiert Gewichte nach dem Training typischerweise auf vier Bit.
  • Quantisierte Modelle lassen sich über die Transformers-API laden und ausführen.

Kritik

  • Niedrige Bitbreite kann bestimmte Fähigkeiten ungleichmäßig verschlechtern und benötigt passende Kernel.

Empfehlungen

  • Teste mehrere Kalibrierungsstichproben und miss Qualitätsverlust auf deinen eigenen Aufgaben.

Referenzen

Originalbeitrag auf Hugging Face lesen →

Im Webarchiv suchen