Beschleunigte Pipelines mit Optimum
Zusammenfassung
Optimum bindet optimierte Laufzeiten in vertraute Transformers-Pipelines ein. Modelle können dadurch mit ONNX Runtime beschleunigt werden, ohne die gesamte Anwendung neu zu schreiben. Optimum bietet ORTModel-Klassen für ONNX Runtime.
Ideen
- Kompatible APIs senken die Kosten, eine optimierte Laufzeit praktisch zu erproben.
- Export und Optimierung müssen als eigener Buildschritt reproduzierbar bleiben.
Fakten
- Optimum bietet ORTModel-Klassen für ONNX Runtime.
- Optimierte Modelle lassen sich über die Transformers-Pipeline-Schnittstelle verwenden.
Kritik
- API-Kompatibilität garantiert weder identische Ergebnisse noch Beschleunigung für jedes Modell.
Empfehlungen
- Vergleiche Ausgaben und numerische Toleranzen vor und nach Export sowie Quantisierung.
Referenzen
Originalbeitrag auf Hugging Face lesen →
Links zur Originalquelle und zum Webarchiv öffnen einen neuen Tab.