Wissensstufe: Einfach

  • Transformer und Attention

    Ein Transformer bewertet, welche Teile einer Eingabe für andere Teile besonders wichtig sind. Dieser Attention-Mechanismus ermöglicht kontextabhängige Repräsentationen und eine stark parallelisierbare Verarbeitung.

    Einfach erklärt

    In einem Satz hängt die Bedeutung eines Wortes von anderen Wörtern ab. Attention berechnet, auf welche Stellen das Modell bei der Verarbeitung besonders achten sollte.

    Bei „Die Bank am Fluss“ und „die Bank überweist Geld“ erhält das Wort „Bank“ durch den umgebenden Kontext unterschiedliche Repräsentationen.

    Anschauliches Beispiel

    Bei der Übersetzung eines langen Satzes kann ein Transformer für jedes Wort Beziehungen zu allen relevanten Wörtern berechnen. Dadurch muss Information nicht nur Schritt für Schritt durch eine lange Kette weitergereicht werden.

    Fortgeschrittene Erklärung

    Self-Attention erzeugt aus Eingaberepräsentationen Query-, Key- und Value-Vektoren. Ähnlichkeiten zwischen Queries und Keys bestimmen Gewichte, mit denen Values kombiniert werden. Multi-Head Attention berechnet mehrere solcher Beziehungsmuster parallel.

    Positionsinformationen müssen zusätzlich eingebracht werden, weil reine Attention keine natürliche Reihenfolge kennt. Feedforward-Schichten, Residualverbindungen und Normalisierung ergänzen die Architektur.

    Expertenwissen

    Die skalierte Dot-Product-Attention berechnet softmax(QKᵀ/√d)V. Die quadratische Abhängigkeit von der Sequenzlänge ist bei langen Kontexten ein wesentlicher Ressourcenfaktor. Zahlreiche spätere Varianten optimieren Speicher, Rechenaufwand, Positionskodierung und den Umgang mit langen Sequenzen.

    Der ursprüngliche Transformer wurde für maschinelle Übersetzung vorgestellt. Seine Architektur wurde anschließend auf Sprachmodelle, Vision, Audio, Biologie, Robotik und multimodale Systeme übertragen.

    Möglichkeiten und Grenzen

    • Effiziente parallele Verarbeitung während des Trainings.
    • Gute Modellierung weiter Abhängigkeiten in Sequenzen.
    • Hoher Speicher- und Rechenbedarf bei langen Kontexten.
    • Attention-Gewichte sind nicht automatisch eine vollständige Erklärung einer Modellentscheidung.

    Quellen

  • Fine-Tuning

    Zusätzliches Training eines bereits vortrainierten Modells für eine bestimmte Aufgabe, Domäne oder Verhaltensweise.

    Einfach erklärt

    Zusätzliches Training eines bereits vortrainierten Modells für eine bestimmte Aufgabe, Domäne oder Verhaltensweise.

    Beispiel

    Ein allgemeines Sprachmodell wird mit geprüften Fachbeispielen weitertrainiert, damit es eine bestimmte Textsorte besser beherrscht.

    Technische Bedeutung

    Beim Fine-Tuning werden Modellparameter mit einem kleineren, zielgerichteten Datensatz weiter optimiert. Alternativen sind Prompting, RAG und Adapterverfahren.

    Verwandte Begriffe

    Training, Foundation Model, RAG

    Quellen