Ein Sprachmodell liest keine Wörter wie ein Mensch. Es zerlegt Text in Token und berechnet für mögliche Fortsetzungen Wahrscheinlichkeiten. Das Kontextfenster bestimmt, welche Token gleichzeitig berücksichtigt werden.
Einfach erklärt
Token können ganze Wörter, Wortteile, Satzzeichen oder Zeichenfolgen sein. Häufige Wörter bestehen oft aus wenigen Token, seltene Wörter aus mehreren.
Das Kontextfenster ist der begrenzte Arbeitsbereich des Modells. Enthält ein Gespräch mehr Token als verarbeitet werden können, müssen ältere Teile gekürzt, zusammengefasst oder anderweitig gespeichert werden.
Anschauliches Beispiel
Das deutsche Kompositum „Datenschutzfolgenabschätzung“ kann in mehrere Token zerlegt werden. Für das Modell ist deshalb die Anzahl der Wörter nicht identisch mit der Anzahl der verarbeiteten Einheiten.
Fortgeschrittene Erklärung
Tokenizer ordnen Textstücken numerische IDs zu. Das Modell wandelt diese IDs in Vektorrepräsentationen um. Für die nächste Position entsteht eine Wahrscheinlichkeitsverteilung über das Vokabular.
Sampling-Parameter beeinflussen, wie vorhersehbar oder vielfältig eine Ausgabe wird. Eine niedrigere Zufälligkeit kann Antworten konsistenter machen, garantiert aber keine sachliche Richtigkeit.
Expertenwissen
Tokenisierung ist ein Kompromiss zwischen Vokabulargröße und Sequenzlänge. Verfahren wie Byte Pair Encoding oder verwandte Subword-Methoden können unbekannte Wörter aus kleineren Einheiten zusammensetzen.
Die nutzbare Kontextlänge ist nicht mit einem perfekten Langzeitgedächtnis gleichzusetzen. Auch innerhalb des technischen Limits können relevante Informationen übersehen, schwächer gewichtet oder durch konkurrierenden Kontext verdrängt werden.
Möglichkeiten und Grenzen
- Lange Kontexte ermöglichen die Analyse umfangreicher Dokumente und Dialoge.
- Mehr Kontext erhöht Kosten und kann neue Ablenkungen erzeugen.
- Tokenlimits unterscheiden sich je nach Modell und Produkt.
- Ein großer Kontext ersetzt keine strukturierte Dokumentensuche oder Qualitätskontrolle.