Ein Transformer bewertet, welche Teile einer Eingabe für andere Teile besonders wichtig sind. Dieser Attention-Mechanismus ermöglicht kontextabhängige Repräsentationen und eine stark parallelisierbare Verarbeitung.
Einfach erklärt
In einem Satz hängt die Bedeutung eines Wortes von anderen Wörtern ab. Attention berechnet, auf welche Stellen das Modell bei der Verarbeitung besonders achten sollte.
Bei „Die Bank am Fluss“ und „die Bank überweist Geld“ erhält das Wort „Bank“ durch den umgebenden Kontext unterschiedliche Repräsentationen.
Anschauliches Beispiel
Bei der Übersetzung eines langen Satzes kann ein Transformer für jedes Wort Beziehungen zu allen relevanten Wörtern berechnen. Dadurch muss Information nicht nur Schritt für Schritt durch eine lange Kette weitergereicht werden.
Fortgeschrittene Erklärung
Self-Attention erzeugt aus Eingaberepräsentationen Query-, Key- und Value-Vektoren. Ähnlichkeiten zwischen Queries und Keys bestimmen Gewichte, mit denen Values kombiniert werden. Multi-Head Attention berechnet mehrere solcher Beziehungsmuster parallel.
Positionsinformationen müssen zusätzlich eingebracht werden, weil reine Attention keine natürliche Reihenfolge kennt. Feedforward-Schichten, Residualverbindungen und Normalisierung ergänzen die Architektur.
Expertenwissen
Die skalierte Dot-Product-Attention berechnet softmax(QKᵀ/√d)V. Die quadratische Abhängigkeit von der Sequenzlänge ist bei langen Kontexten ein wesentlicher Ressourcenfaktor. Zahlreiche spätere Varianten optimieren Speicher, Rechenaufwand, Positionskodierung und den Umgang mit langen Sequenzen.
Der ursprüngliche Transformer wurde für maschinelle Übersetzung vorgestellt. Seine Architektur wurde anschließend auf Sprachmodelle, Vision, Audio, Biologie, Robotik und multimodale Systeme übertragen.
Möglichkeiten und Grenzen
- Effiziente parallele Verarbeitung während des Trainings.
- Gute Modellierung weiter Abhängigkeiten in Sequenzen.
- Hoher Speicher- und Rechenbedarf bei langen Kontexten.
- Attention-Gewichte sind nicht automatisch eine vollständige Erklärung einer Modellentscheidung.