Transformer-Komponente
Scaled Dot-Product Attention
Mechanismus
Der mathematische Attention-Kern, bei dem das Skalarprodukt von Query und Key durch dividiert und per Softmax normalisiert wird.
Implikation
Stabilisiert das mathematische Verhalten des Netzwerks während des Trainings bei extrem großen Modellschichten.