Multimodal

Ein KI-System ist multimodal, wenn es mehrere Datentypen wie Text, Bild, Audio oder Video verarbeitet oder erzeugt.

Wissensstufe: Status: Zuletzt geprüft: 28.07.2026Primärquelle: CLIP-Paper
Lesedauer: etwa 1 Min.Zur Übersicht

Ein KI-System ist multimodal, wenn es mehrere Datentypen wie Text, Bild, Audio oder Video verarbeitet oder erzeugt.

Einfach erklärt

Ein KI-System ist multimodal, wenn es mehrere Datentypen wie Text, Bild, Audio oder Video verarbeitet oder erzeugt.

Beispiel

Ein System beschreibt ein Foto und beantwortet anschließend eine gesprochene Frage dazu.

Technische Bedeutung

Modalitäten können über getrennte Encoder, gemeinsame Repräsentationsräume oder vereinheitlichte Token verbunden werden.

Verwandte Begriffe

Embedding, Vision-Language-Modell, Audio

Quellen