Transformer für lange Dokumente
Zusammenfassung
Die Literaturübersicht ordnet Verfahren ein, die den quadratischen Aufwand voller Attention umgehen. Lokale Fenster, Sparsität und komprimierte Repräsentationen tauschen globale Sicht gegen Skalierbarkeit. Volle Self-Attention wächst quadratisch mit der Sequenzlänge.
Ideen
- Lange Kontexte benötigen eine definierte Informationsroute zwischen weit entfernten Token.
- Jede Attention-Approximation legt fest, welche Beziehungen ein Modell leicht lernen kann.
Einsichten
- Architekturentscheidungen verteilen Rechenkosten und Informationswege; sie sind keine bloßen Implementierungsdetails.
Fakten
- Volle Self-Attention wächst quadratisch mit der Sequenzlänge.
- Longformer und BigBird verwenden sparse Attention-Muster für längere Eingaben.
Kritik
- Maximale Kontextlänge allein misst weder nutzbare Erinnerung noch Antwortqualität.
Empfehlungen
- Prüfe bei langen Dokumenten, ob gesuchte Informationen die gewählte Attention-Struktur erreichen können.
Referenzen
Originalbeitrag auf Hugging Face lesen →
Links zur Originalquelle und zum Webarchiv öffnen einen neuen Tab.