Mixture-of-Experts-Modelle (MoE)

MoE-Modelle aktivieren für jeden Eingabeteil nur einen Teil ihrer spezialisierten Netzwerke.

Lesedauer: etwa 1 Min.Zur Übersicht

Ein Mixture-of-Experts-Modell enthält mehrere sogenannte Experten. Ein Router entscheidet für jedes Token, welche Experten berechnet werden. Dadurch kann ein Modell sehr viele Parameter besitzen, ohne bei jeder Eingabe alle Parameter zu verwenden.

Einfach erklärt

Statt jede Frage an die gesamte Mannschaft zu geben, verteilt ein Router einzelne Aufgaben an wenige passende Spezialisten.

Technische Grundidee

  • Mehrere Feed-Forward-Netze dienen als Experten
  • Ein Routing-Netz berechnet Auswahlgewichte
  • Nur die ausgewählten Experten verarbeiten das jeweilige Token
  • Die Ergebnisse werden gewichtet zusammengeführt

Vorteile

  • Hohe Modellkapazität bei begrenztem Rechenaufwand pro Token
  • Spezialisierung verschiedener Experten kann entstehen
  • Skalierung auf sehr große Parameterzahlen

Herausforderungen

  • Ungleichmäßige Auslastung einzelner Experten
  • Hoher Kommunikationsaufwand über mehrere Beschleuniger
  • Komplexere Bereitstellung und Optimierung
  • Gesamtparameterzahl ist nicht direkt mit aktiv genutzten Parametern vergleichbar

Einordnung

MoE ist eine Architekturentscheidung und kein Beleg für bessere Qualität. Vergleichbar sind Modelle nur über konkrete Aufgaben, aktive Rechenkosten, Speicherbedarf und unabhängige Evaluationen.

Primärquellen