bk99.de entertain the web since 1997

Schnellere Ausgabe durch selbstspekulatives Decoding

Zusammenfassung

LayerSkip nutzt frühe Schichten desselben Modells als schnellen Entwurf und prüft Vorschläge mit dem vollständigen Modell. Ein separates Draft-Modell wird dadurch unnötig. Self-Speculative Decoding verwendet dasselbe Modell für Entwurf und Verifikation.

Ideen

  • Ein Modell kann eigene Zwischenrepräsentationen als kostengünstige Vorschläge verwenden.
  • Beschleunigung hängt davon ab, wie oft das vollständige Modell frühe Token akzeptiert.

Fakten

  • Self-Speculative Decoding verwendet dasselbe Modell für Entwurf und Verifikation.
  • Training mit Layer Drop und frühem Exit verbessert die Brauchbarkeit früher Schichten.

Kritik

  • Das Verfahren benötigt passend trainierte Modelle und gewinnt wenig bei niedriger Akzeptanzrate.

Empfehlungen

  • Miss Akzeptanzrate und Ausgabeidentität für unterschiedliche Aufgaben und Sequenzlängen.

Referenzen

Originalbeitrag auf Hugging Face lesen →

Im Webarchiv suchen