Zurück zum Glossar
    Alignment

    RLHF

    Mechanismus

    Dreistufiger Optimierungsprozess mittels menschlicher Feedback-Daten, Reward-Modellierung und Reinforcement Learning.

    Implikation

    Ermöglicht die Modellierung komplexer, subjektiver Konzepte von Hilfsbereitschaft und Sicherheit.

    Ausführliche Erklärung