Dreißig LoRA-Modelle mit einem Server bedienen
Zusammenfassung
Text Generation Inference lädt viele LoRA-Adapter über einem gemeinsamen Basismodell und bedient sie gemeinsam. Das vermeidet vollständige Modellkopien und verbessert die Auslastung. Die Demonstration bedient 30 LoRA-Modelle über eine TGI-Instanz.
Ideen
- Adapter-Multitenancy teilt teure Basisgewichte zwischen spezialisierten Diensten.
- Scheduler müssen verschiedene Adapter ohne unfaire Latenzspitzen gemeinsam stapeln.
Fakten
- Die Demonstration bedient 30 LoRA-Modelle über eine TGI-Instanz.
- Alle Adapter verwenden dasselbe geladene Basismodell.
Kritik
- Die Zahl möglicher Adapter hängt von Größe, Verkehrsmuster und gemeinsamem Basismodell ab.
Empfehlungen
- Setze Speicherlimits pro Adapter und teste Fairness sowie Tail-Latenz bei gemischter Last.
Referenzen
Originalbeitrag auf Hugging Face lesen →
Links zur Originalquelle und zum Webarchiv öffnen einen neuen Tab.