bk99.de entertain the web since 1997

Dreißig LoRA-Modelle mit einem Server bedienen

Zusammenfassung

Text Generation Inference lädt viele LoRA-Adapter über einem gemeinsamen Basismodell und bedient sie gemeinsam. Das vermeidet vollständige Modellkopien und verbessert die Auslastung. Die Demonstration bedient 30 LoRA-Modelle über eine TGI-Instanz.

Ideen

  • Adapter-Multitenancy teilt teure Basisgewichte zwischen spezialisierten Diensten.
  • Scheduler müssen verschiedene Adapter ohne unfaire Latenzspitzen gemeinsam stapeln.

Fakten

  • Die Demonstration bedient 30 LoRA-Modelle über eine TGI-Instanz.
  • Alle Adapter verwenden dasselbe geladene Basismodell.

Kritik

  • Die Zahl möglicher Adapter hängt von Größe, Verkehrsmuster und gemeinsamem Basismodell ab.

Empfehlungen

  • Setze Speicherlimits pro Adapter und teste Fairness sowie Tail-Latenz bei gemischter Last.

Referenzen

Originalbeitrag auf Hugging Face lesen →

Im Webarchiv suchen