bk99.de entertain the web since 1997

LLaMA mit RLHF trainieren

Zusammenfassung

StackLLaMA führt Supervised Fine-Tuning, Belohnungsmodell und PPO als vollständige RLHF-Pipeline zusammen. Der Leitfaden zeigt, wie PEFT und Quantisierung die Hardwareanforderungen senken. Die Pipeline verwendet zunächst Instruktionsdaten für überwachtes Fine-Tuning.

Ideen

  • RLHF besteht aus mehreren voneinander abhängigen Modellen und Datenphasen.
  • Ein fehlerhaftes Belohnungsmodell kann überzeugend wirkende, aber unerwünschte Strategien fördern.

Einsichten

  • Skalierbares Training braucht reproduzierbare Übergänge zwischen Code, Daten, Geräten und Checkpoints.

Fakten

  • Die Pipeline verwendet zunächst Instruktionsdaten für überwachtes Fine-Tuning.
  • Anschließend optimiert PPO Antworten gegen ein gelerntes Belohnungsmodell.

Kritik

  • Präferenzdaten bilden die Werte und blinden Flecken ihrer Annotierenden ab.

Empfehlungen

  • Evaluiere jede Trainingsstufe separat und suche gezielt nach Reward Hacking.

Referenzen

Originalbeitrag auf Hugging Face lesen →

Im Webarchiv suchen