Ein Mixture-of-Experts-Modell enthält mehrere sogenannte Experten. Ein Router entscheidet für jedes Token, welche Experten berechnet werden. Dadurch kann ein Modell sehr viele Parameter besitzen, ohne bei jeder Eingabe alle Parameter zu verwenden.
Einfach erklärt
Statt jede Frage an die gesamte Mannschaft zu geben, verteilt ein Router einzelne Aufgaben an wenige passende Spezialisten.
Technische Grundidee
- Mehrere Feed-Forward-Netze dienen als Experten
- Ein Routing-Netz berechnet Auswahlgewichte
- Nur die ausgewählten Experten verarbeiten das jeweilige Token
- Die Ergebnisse werden gewichtet zusammengeführt
Vorteile
- Hohe Modellkapazität bei begrenztem Rechenaufwand pro Token
- Spezialisierung verschiedener Experten kann entstehen
- Skalierung auf sehr große Parameterzahlen
Herausforderungen
- Ungleichmäßige Auslastung einzelner Experten
- Hoher Kommunikationsaufwand über mehrere Beschleuniger
- Komplexere Bereitstellung und Optimierung
- Gesamtparameterzahl ist nicht direkt mit aktiv genutzten Parametern vergleichbar
Einordnung
MoE ist eine Architekturentscheidung und kein Beleg für bessere Qualität. Vergleichbar sind Modelle nur über konkrete Aufgaben, aktive Rechenkosten, Speicherbedarf und unabhängige Evaluationen.