Zurück zum Glossar
    Transformer-Komponente

    Scaled Dot-Product Attention

    Mechanismus

    Der mathematische Attention-Kern, bei dem das Skalarprodukt von Query und Key durch dividiert und per Softmax normalisiert wird.

    Implikation

    Stabilisiert das mathematische Verhalten des Netzwerks während des Trainings bei extrem großen Modellschichten.

    Ausführliche Erklärung