Alignment
DPO (Direct Preference Optimization)
Mechanismus
Direktes Alignment über binäre Kreuzentropie-Verluste auf Basis relativer Wahrscheinlichkeitsänderungen der Modellpolitik.
Implikation
Bietet ein hochgradig stabiles, mathematisch elegantes und recheneffizientes Alignment-Verfahren für Großmodelle.