Ein KI-System ist multimodal, wenn es mehrere Datentypen wie Text, Bild, Audio oder Video verarbeitet oder erzeugt.
Einfach erklärt
Ein KI-System ist multimodal, wenn es mehrere Datentypen wie Text, Bild, Audio oder Video verarbeitet oder erzeugt.
Beispiel
Ein System beschreibt ein Foto und beantwortet anschließend eine gesprochene Frage dazu.
Technische Bedeutung
Modalitäten können über getrennte Encoder, gemeinsame Repräsentationsräume oder vereinheitlichte Token verbunden werden.
Verwandte Begriffe
Embedding, Vision-Language-Modell, Audio