Transformer-Komponente
Multi-Head Attention
Mechanismus
Parallele Ausführung mehrerer Self-Attention-Berechnungen (Heads) in unterschiedlich projizierten Vektorräumen.
Implikation
Erlaubt dem Modell, verschiedene Aspekte der Repräsentation und Grammatik gleichzeitig mathematisch zu analysieren.