Trainingsstrategie
SFT (Supervised Fine-Tuning)
Mechanismus
Die initiale Phase des Alignments, in der das Modell lernt, hochwertige Dialogbeispiele imitatio-basiert nachzubilden.
Implikation
Bildet die zwingend notwendige mathematische Ausgangsbasis für nachgelagerte Präferenzoptimierungen.