Medium oder Format: 3D

  • Diffusionsmodelle

    Ein Diffusionsmodell kann aus Rauschen schrittweise ein strukturiertes Bild oder andere Daten erzeugen. Es hat im Training gelernt, wie verrauschte Beispiele wieder in plausible Daten zurückgeführt werden.

    Einfach erklärt

    Im Training wird ein Bild zunehmend verrauscht. Das Modell lernt für viele Rauschstufen, wie es einen kleinen Teil dieses Rauschens wieder entfernen kann.

    Bei der Erzeugung beginnt das System mit Rauschen und wiederholt den gelernten Entrauschungsschritt. Eine Texteingabe kann den Prozess in Richtung eines gewünschten Motivs steuern.

    Anschauliches Beispiel

    Aus einer zufälligen Pixelwolke entstehen zuerst grobe Flächen, dann Formen, Objekte und Details. Der Prozess ist nicht mit dem Freilegen eines versteckten fertigen Bildes gleichzusetzen; das Bild wird während der Berechnung erzeugt.

    Fortgeschrittene Erklärung

    Denoising Diffusion Probabilistic Models definieren einen Vorwärtsprozess, der Daten schrittweise in Rauschen überführt, und einen gelernten Rückwärtsprozess. In praktischen Bildsystemen findet die Diffusion häufig in einem komprimierten latenten Raum statt.

    Konditionierung kann über Text-Embeddings, Bilder, Kanten, Tiefenkarten oder andere Steuersignale erfolgen. Dadurch sind Text-zu-Bild, Bildvariation, Inpainting und strukturell kontrollierte Erzeugung möglich.

    Expertenwissen

    Der Rückwärtsprozess approximiert bedingte Übergangsverteilungen beziehungsweise eine Score-Funktion. Die Trainingsziele können auf Rauschvorhersage, Datenvorhersage oder andere Parametrisierungen ausgerichtet sein.

    Sampling-Verfahren beeinflussen Geschwindigkeit, Qualität und Reproduzierbarkeit. Weniger Schritte beschleunigen die Erzeugung, können aber Detailtreue und Stabilität verändern.

    Möglichkeiten und Grenzen

    • Hochwertige Erzeugung und Bearbeitung von Bildern sowie zunehmend weiterer Modalitäten.
    • Gezielte Steuerung über Text und zusätzliche Kontrollsignale.
    • Details, Textdarstellung und räumliche Konsistenz können fehlerhaft sein.
    • Trainingsdaten, Urheberrecht, Identitätsmissbrauch und Deepfakes erfordern klare Regeln.

    Quellen

  • Multimodale KI

    Ein multimodales KI-System kann mehrere Medienarten miteinander verknüpfen. Es kann beispielsweise ein Bild analysieren, eine Frage dazu verstehen und eine gesprochene Antwort erzeugen.

    Einfach erklärt

    Menschen nehmen die Welt nicht nur als Text wahr. Multimodale Systeme verbinden verschiedene Formen von Information – zum Beispiel Wörter, Bilder, Töne, Videos oder Sensordaten.

    Dadurch kann ein System Inhalte zwischen Modalitäten übersetzen: ein Bild beschreiben, Sprache transkribieren, aus Text ein Bild erzeugen oder Video und Ton gemeinsam auswerten.

    Anschauliches Beispiel

    Ein Nutzer fotografiert eine defekte Maschine und stellt dazu eine gesprochene Frage. Ein multimodales System kann Bild und Sprache gemeinsam verarbeiten und eine textliche oder gesprochene Hilfestellung erzeugen. Für eine verlässliche Diagnose wären jedoch technische Dokumente und fachliche Prüfung nötig.

    Fortgeschrittene Erklärung

    Multimodale Modelle verwenden Encoder und Decoder für unterschiedliche Datentypen oder eine gemeinsame Tokenrepräsentation. Kontrastives Lernen kann Bild- und Textrepräsentationen in einem gemeinsamen Raum ausrichten.

    Vision-Language-Modelle kombinieren visuelle Merkmale mit Sprachmodellen. Weitere Systeme integrieren Audio, Video, 3D oder Roboteraktionen.

    Expertenwissen

    CLIP zeigte, wie Bild- und Textencoder durch kontrastives Lernen auf große Mengen gepaarter Bild-Text-Daten ausgerichtet werden können. Flamingo verband vortrainierte visuelle und sprachliche Komponenten für flexible visuelle Fragebeantwortung und Few-Shot-Lernen.

    Aktuelle Systeme unterscheiden sich stark darin, ob Modalitäten nativ gemeinsam trainiert, über Adapter verbunden oder über getrennte Spezialmodelle orchestriert werden. Multimodalität allein garantiert weder räumliches Verständnis noch physikalische Korrektheit.

    Möglichkeiten und Grenzen

    • Barrierefreiheit durch Bildbeschreibung, Transkription und Sprachausgabe.
    • Medienproduktion, visuelle Recherche und technische Assistenz.
    • Fehler können sich aus mehreren Modalitäten gegenseitig verstärken.
    • Bilder, Stimmen und Videos erhöhen Datenschutz- und Identitätsrisiken.
    • Sensordaten benötigen domänenspezifische Validierung.

    Quellen