Zurück zum Glossar
    Transformer-Komponente

    Multi-Head Attention

    Mechanismus

    Parallele Ausführung mehrerer Self-Attention-Berechnungen (Heads) in unterschiedlich projizierten Vektorräumen.

    Implikation

    Erlaubt dem Modell, verschiedene Aspekte der Repräsentation und Grammatik gleichzeitig mathematisch zu analysieren.

    Ausführliche Erklärung