bk99.de entertain the web since 1997

Beschleunigte Pipelines mit Optimum

Zusammenfassung

Optimum bindet optimierte Laufzeiten in vertraute Transformers-Pipelines ein. Modelle können dadurch mit ONNX Runtime beschleunigt werden, ohne die gesamte Anwendung neu zu schreiben. Optimum bietet ORTModel-Klassen für ONNX Runtime.

Ideen

  • Kompatible APIs senken die Kosten, eine optimierte Laufzeit praktisch zu erproben.
  • Export und Optimierung müssen als eigener Buildschritt reproduzierbar bleiben.

Fakten

  • Optimum bietet ORTModel-Klassen für ONNX Runtime.
  • Optimierte Modelle lassen sich über die Transformers-Pipeline-Schnittstelle verwenden.

Kritik

  • API-Kompatibilität garantiert weder identische Ergebnisse noch Beschleunigung für jedes Modell.

Empfehlungen

  • Vergleiche Ausgaben und numerische Toleranzen vor und nach Export sowie Quantisierung.

Referenzen

Originalbeitrag auf Hugging Face lesen →

Im Webarchiv suchen