Schnellere Ausgabe durch selbstspekulatives Decoding
Zusammenfassung
LayerSkip nutzt frühe Schichten desselben Modells als schnellen Entwurf und prüft Vorschläge mit dem vollständigen Modell. Ein separates Draft-Modell wird dadurch unnötig. Self-Speculative Decoding verwendet dasselbe Modell für Entwurf und Verifikation.
Ideen
- Ein Modell kann eigene Zwischenrepräsentationen als kostengünstige Vorschläge verwenden.
- Beschleunigung hängt davon ab, wie oft das vollständige Modell frühe Token akzeptiert.
Fakten
- Self-Speculative Decoding verwendet dasselbe Modell für Entwurf und Verifikation.
- Training mit Layer Drop und frühem Exit verbessert die Brauchbarkeit früher Schichten.
Kritik
- Das Verfahren benötigt passend trainierte Modelle und gewinnt wenig bei niedriger Akzeptanzrate.
Empfehlungen
- Miss Akzeptanzrate und Ausgabeidentität für unterschiedliche Aufgaben und Sequenzlängen.
Referenzen
Originalbeitrag auf Hugging Face lesen →
Links zur Originalquelle und zum Webarchiv öffnen einen neuen Tab.